{"as_of":"2026-08-16T23:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f4c4172b7b6388743c3aa6c45aae7b62a94af3b209a26759fd7a0f0bd9aaa488","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:25:54.739885Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T16:31:17.631468Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T13:35:46.511843Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-09T16:31:17.631468Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01142","last_updated":"2025-06-08T17:17:01Z","snapshot_observed_at":"2026-08-16T06:53:43.197637Z","submitted_at":"2025-02-03T08:22:45Z","title":"DeepRAG: Thinking to Retrieve Step by Step for Large Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T16:31:17.631468Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2502.01142"},"observation_digest":"sha256:67bca2077106f16b01649eda00f8fe761ed6d1de302bf9651b9333834bc762e7","observation_id":"a031d7ea-8d7d-4aba-b5f7-4741d1b3ae63","resolution":{"observed_at":"2026-08-09T16:31:17.631468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-07T14:00:06.780943Z","title":"Auto-rt: Automatic jailbreak strategy exploration for red-teaming large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20259","last_updated":"2025-05-26T17:40:40Z","snapshot_observed_at":"2026-08-10T01:20:47.147597Z","submitted_at":"2025-05-26T17:40:40Z","title":"Lifelong Safety Alignment for Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:00:06.780943Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2505.20259"},"observation_digest":"sha256:c1118ac422726b18543339d6a4fbfa747aae38e817ec4c77d781f63b27b1a0f8","observation_id":"d0d40a5b-e08c-4b30-abcc-3a8f1b8ef07c","resolution":{"observed_at":"2026-08-07T14:00:06.780943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-07T12:01:09.082636Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00782","last_updated":"2025-06-01T02:19:46Z","snapshot_observed_at":"2026-08-15T19:27:55.447477Z","submitted_at":"2025-06-01T02:19:46Z","title":"Jailbreak-R1: Exploring the Jailbreak Capabilities of LLMs via Reinforcement Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:01:09.082636Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2506.00782"},"observation_digest":"sha256:9e12112303add9c62d16ceb0bd25d107b95694b191e358ac3509a2d739d1dedc","observation_id":"7ef22d1b-236d-4d76-b9a5-70094e50e563","resolution":{"observed_at":"2026-08-07T12:01:09.082636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-07T05:47:06.366957Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07121","last_updated":"2026-08-01T10:21:24Z","snapshot_observed_at":"2026-08-16T09:30:38.438626Z","submitted_at":"2025-06-08T13:07:41Z","title":"Quality-Diversity Red-Teaming: Automated Generation of High-Quality and Diverse Attackers for Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:47:06.366957Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2506.07121"},"observation_digest":"sha256:e8d2113c7a8fcf4b9ea3c192294fe044007aa3d18c8ce13c3839c7e93234f45a","observation_id":"c72098f9-5c78-41b4-9fcf-a7936fadf178","resolution":{"observed_at":"2026-08-07T05:47:06.366957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.01830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-07-01T13:35:46.511843Z","title":"Auto- rt: Automatic jailbreak strategy exploration for red-teaming large language models.ArXiv, abs/2501.01830","venue":null,"work_id":"33a16668-8470-4f49-bed0-1577d00b1fd9","year":2025},"citing_paper":{"arxiv_id":"2605.05058","last_updated":"2026-05-06T15:53:17Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T15:53:17Z","title":"SoK: Robustness in Large Language Models against Jailbreak Attacks","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-08T16:42:41.137808Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2605.05058"},"observation_digest":"sha256:117f9c5b5c7cff6e7ac6f9d1bb384cc9cbab298a6aae10188ae40922613ac839","observation_id":"e13f4df1-45cd-439e-ac90-5f8b31b6071e","resolution":{"observed_at":"2026-05-11T18:01:08.754558Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.01830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-07-01T13:35:46.511843Z","title":"Auto- rt: Automatic jailbreak strategy exploration for red-teaming large language models.ArXiv, abs/2501.01830","venue":null,"work_id":"33a16668-8470-4f49-bed0-1577d00b1fd9","year":2025},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:32:42.151644Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:badb5b9679ec753a551b415e2c2d41e9978383b5f0e2a257141d0e4b0453097f","observation_id":"0406f2c3-d165-41d2-a9e0-e8858dc22804","resolution":{"observed_at":"2026-05-11T01:40:52.581648Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.01830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-07-01T13:35:46.511843Z","title":"Auto- rt: Automatic jailbreak strategy exploration for red-teaming large language models.ArXiv, abs/2501.01830","venue":null,"work_id":"33a16668-8470-4f49-bed0-1577d00b1fd9","year":2025},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T22:59:07.861941Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:89895a3236162adf35845623203ea1a9bea3f8e92661a4dabf1d55995ff96903","observation_id":"e46035ef-e850-464c-b33b-4ba0161d5f47","resolution":{"observed_at":"2026-07-01T13:35:46.513609Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.01830","snapshot_observed_at":"2026-08-02T14:41:06.420030Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models.arXiv preprint 2501.01830,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.07032","last_updated":"2026-07-20T17:49:20Z","snapshot_observed_at":"2026-08-02T14:41:04.240876Z","submitted_at":"2026-05-07T23:22:07Z","title":"A Systematic Investigation of RL-Jailbreaking in LLMs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:41:06.420030Z"},"links":{"cited_paper":"/paper/2501.01830","citing_paper":"/paper/2605.07032"},"observation_digest":"sha256:ab0797179a79c62e40803e4944e2d915555bff3d2f7fd7abd573dd1160ad2d9e","observation_id":"0437a9e8-bf6f-4e51-ab31-df5006ffa24b","resolution":{"observed_at":"2026-08-02T14:41:06.420030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.01830/citation-record","integrity":"/paper/2501.01830/integrity","json":"/paper/2501.01830/citation-record.json","paper":"/paper/2501.01830"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.517346Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.517346Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:5e127e31ea309054caf336ff69b58f3d7251b92e3056a5bcaa6b8501acc2e02b","observation_id":"9e845f25-ecb1-428e-bf8b-e8cfb61fd540","resolution":{"observed_at":"2026-08-10T22:25:54.517346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.523608Z","title":"Constrained policy optimization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.523608Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:967f4171cdcb7e0cdd71ea680d33913c2bdc7eddb7c9d1d068bb14d35afa5b23","observation_id":"8c3c5024-00f3-40ad-b79e-84faf57cba39","resolution":{"observed_at":"2026-08-10T22:25:54.523608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-10T22:25:54.528176Z","title":"Yi: Open foundation models by 01.ai, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.528176Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:b8c520edb75fbecaced6ddda98d849db22919c28cbc406b16fead275d462fbe9","observation_id":"798bce14-0b0d-4892-adcb-37ed42899ca8","resolution":{"observed_at":"2026-08-10T22:25:54.528176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.515076Z","title":"and Cook, R","venue":null,"work_id":"3ab03c1c-7b45-452e-9913-dd7d975dff97","year":2010},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.533228Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:ded3d7efb6faa60ccf878f0b4e48ad0bbb1f28d6569bb5f835c787f8bb17b282","observation_id":"e2dbb23a-3724-460b-b169-8a805c30e9ea","resolution":{"observed_at":"2026-08-10T22:25:55.520386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.500989Z","title":"Constrained markov decision processes","venue":null,"work_id":"ff17e59e-85c0-484b-b5cd-abb76541a37a","year":1999},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.537586Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:df6a43a423c2853b8b6d09df0e3ba556b7f8178b07b8adf07ce257e858631817","observation_id":"d679dd21-39bb-4686-a3f8-d785b220b1b9","resolution":{"observed_at":"2026-08-10T22:25:55.505394Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.11969","last_updated":"2025-04-17T18:36:08Z","snapshot_observed_at":"2026-08-16T13:33:39.713426Z","submitted_at":"2024-07-16T17:59:55Z","title":"Does Refusal Training in LLMs Generalize to the Past Tense?","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.11969","snapshot_observed_at":"2026-08-10T22:25:54.542105Z","title":"and Flammarion, N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.542105Z"},"links":{"cited_paper":"/paper/2407.11969","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:0312d549aed40cf8ca5df3ffb0f189346917ea3018b9b9ee1cb79d45f4ca9648","observation_id":"dbb8623c-7aa3-46b4-9cd5-b4a19c048a0a","resolution":{"observed_at":"2026-08-10T22:25:54.542105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.546943Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.546943Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:a37dae12647191ec67b18c8b34f40a1176473d92381503a8d04451749a8a4b59","observation_id":"6afc68dc-c61f-46b8-9a14-16ae69c059c8","resolution":{"observed_at":"2026-08-10T22:25:54.546943Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.478677Z","title":null,"venue":null,"work_id":"03bc51e4-d278-486b-ad2a-e192eba0d653","year":2021},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.551471Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:eeb79e8fb620f1d67a68576c3a57846a4b502845027f19c6536385c004ce4f30","observation_id":"a8f4a11f-591b-4bc8-8177-9b4103c39a26","resolution":{"observed_at":"2026-08-10T22:25:55.483143Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.464442Z","title":"and Bailey, D","venue":null,"work_id":"1f46ac88-8875-428e-96f4-689d8c885bc1","year":1996},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.555359Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:11ab3828cdc0fb24af4b9cd4cf6a72d2599f2d8a0d8b9f1e63805694e443bfe3","observation_id":"5c69d931-73a6-4970-a13d-9ff1d4eacbfe","resolution":{"observed_at":"2026-08-10T22:25:55.469140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.450693Z","title":null,"venue":null,"work_id":"198177d1-391e-4032-b496-b17831f2d4db","year":2004},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.559580Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:646cea1a9a977b57f629ae48c6c98327301fc07ef1b01d8ea848f855ab1f0236","observation_id":"521d5ff0-48c6-4870-ab52-1517ec408806","resolution":{"observed_at":"2026-08-10T22:25:55.455142Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.435649Z","title":"K., Savage, S., and Voelker, G","venue":null,"work_id":"babba4d1-7f86-47ee-a117-9c5d1fc1b3a1","year":2010},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.563620Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:fe20efebaa0e14d77a70512f57bb6dcd35e15f5dbe36e8a9cab4f157b77a59a3","observation_id":"c0c23b09-df15-4136-87ed-639ce2894606","resolution":{"observed_at":"2026-08-10T22:25:55.439927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-10T22:25:54.567857Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.567857Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:8910c006d6145b5aec5624dd8c0ffe25b8dda249a58fe82a361c08f2424246fe","observation_id":"ce11943d-57af-4f62-a2ca-6367b14e4abf","resolution":{"observed_at":"2026-08-10T22:25:54.567857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.572406Z","title":"E., Stoica, I., and Xing, E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.572406Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:5e1303af8ea7a0fdd9b0ab2c56d0150ce079df709e3b8a834701ffe92eb08eed","observation_id":"b32a6893-a88d-4b45-95ae-ecef7063250d","resolution":{"observed_at":"2026-08-10T22:25:54.572406Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.12773","last_updated":"2023-10-19T14:22:03Z","snapshot_observed_at":"2026-08-14T19:10:00.850271Z","submitted_at":"2023-10-19T14:22:03Z","title":"Safe RLHF: Safe Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.12773","snapshot_observed_at":"2026-08-10T22:25:54.576434Z","title":"Safe rlhf: Safe reinforcement learning from human feedback","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.576434Z"},"links":{"cited_paper":"/paper/2310.12773","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:bbc82e9e774f2cc61889b7b53fe42580be7557532bc736b8dbe6eeddf3075131","observation_id":"3bcaff9c-3acd-4174-8fba-34545924e734","resolution":{"observed_at":"2026-08-10T22:25:54.576434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T22:25:54.580690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.580690Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:096a25c4bef6cb833e86e7cc40ae50c3ee327678d5f4b8533865b5cb91090695","observation_id":"4c0012d2-f49d-4bae-a40b-fe3ad1d8c73c","resolution":{"observed_at":"2026-08-10T22:25:54.580690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.12901","last_updated":"2019-04-29T18:40:15Z","snapshot_observed_at":"2026-08-14T16:39:48.171461Z","submitted_at":"2019-04-29T18:40:15Z","title":"Challenges of Real-World Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.12901","snapshot_observed_at":"2026-08-10T22:25:54.585351Z","title":"Challenges of real-world reinforcement learning, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.585351Z"},"links":{"cited_paper":"/paper/1904.12901","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:2d496f6ec8c041a48edfbb1a03ee55c1101323dd56b2fcc66481a563548c0b73","observation_id":"c14162d4-1025-4355-86fb-efc46394a0f1","resolution":{"observed_at":"2026-08-10T22:25:54.585351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07689","last_updated":"2023-11-13T19:13:29Z","snapshot_observed_at":"2026-08-16T14:43:39.724771Z","submitted_at":"2023-11-13T19:13:29Z","title":"MART: Improving LLM Safety with Multi-round Automatic Red-Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07689","snapshot_observed_at":"2026-08-10T22:25:54.589698Z","title":"Mart: Improving llm safety with multi-round automatic red-teaming, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.589698Z"},"links":{"cited_paper":"/paper/2311.07689","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:12e2820aaeebb70214f08352b93351f7c75ea49922a6744899f396a70850f0f8","observation_id":"7dff4194-51d3-481f-9f1e-907f38d1b702","resolution":{"observed_at":"2026-08-10T22:25:54.589698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13733","last_updated":"2021-04-15T17:43:43Z","snapshot_observed_at":"2026-08-16T18:31:18.416352Z","submitted_at":"2021-04-15T17:43:43Z","title":"Gradient-based Adversarial Attacks against Text Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13733","snapshot_observed_at":"2026-08-10T22:25:54.594335Z","title":"Gradient-based adversarial attacks against text transformers, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.594335Z"},"links":{"cited_paper":"/paper/2104.13733","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:5a6163722a4029609927954c449935e7f0b8d8a654ae5c66001d76570aa2339d","observation_id":"a8d92230-73ab-4d7f-842e-27320e4e435e","resolution":{"observed_at":"2026-08-10T22:25:54.594335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-16T14:18:53.099186Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-10T22:25:54.598462Z","title":"Cold-attack: Jailbreaking llms with stealthiness and controllability","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.598462Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:5946513a1598b2558fe4a2635b3051605ce8cb0c636faa8cbb1fa7073d7db70e","observation_id":"09129e28-8378-4284-81ed-04b0ac547eba","resolution":{"observed_at":"2026-08-10T22:25:54.598462Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.413226Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":"07a11b65-6344-4845-93d0-7292b0559837","year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.602587Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:68e7174e61a8d232028e4f3a55a266c1e16d919053ef5a98aa4d14fa8fdb8332","observation_id":"b9b4af55-9ea7-42cb-adb2-e89b78c9a7c7","resolution":{"observed_at":"2026-08-10T22:25:55.417831Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T22:25:54.606381Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.606381Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:03245e45eacb620ccc61734f686a2d7d137812d755273dd8b610b99283cec4d1","observation_id":"2db33961-23dd-4b42-968b-3eb62241ab12","resolution":{"observed_at":"2026-08-10T22:25:54.606381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00267","last_updated":"2024-09-03T14:01:54Z","snapshot_observed_at":"2026-08-15T10:07:24.540946Z","submitted_at":"2023-09-01T05:53:33Z","title":"RLAIF vs. RLHF: Scaling Reinforcement Learning from Human Feedback with AI Feedback","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00267","snapshot_observed_at":"2026-08-10T22:25:54.610490Z","title":"Rlaif vs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.610490Z"},"links":{"cited_paper":"/paper/2309.00267","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:af7bf404012e44e4baf9083d48bc2380aef66ae4b79559beed02214c8718a695","observation_id":"a0ea4762-ffe1-460a-b9f9-87626d67ea2c","resolution":{"observed_at":"2026-08-10T22:25:54.610490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05295","last_updated":"2025-04-22T05:20:39Z","snapshot_observed_at":"2026-08-16T13:12:51.255052Z","submitted_at":"2024-10-03T17:59:01Z","title":"AutoDAN-Turbo: A Lifelong Agent for Strategy Self-Exploration to Jailbreak LLMs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05295","snapshot_observed_at":"2026-08-10T22:25:54.614748Z","title":"Autodan-turbo: A lifelong agent for strategy self-exploration to jailbreak llms, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.614748Z"},"links":{"cited_paper":"/paper/2410.05295","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:b29f90938da866aab9f4a12c52543479dd67c73b6736d9ae9807e10bcca1bf63","observation_id":"30900c49-d046-47af-951d-ce9610ed1ad3","resolution":{"observed_at":"2026-08-10T22:25:54.614748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-10T22:25:54.618480Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.618480Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:e16b03581057a11be2bb3598c900253447c87bd788440e2628a6fd7104dda6a4","observation_id":"92116db0-d5b0-4e42-9e39-e6f23640ae46","resolution":{"observed_at":"2026-08-10T22:25:54.618480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.622364Z","title":"Summary of chatgpt-related research and perspective towards the future of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.622364Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:243acb9534a1f95d4b51b4fa50ab72aefa9874184b290344af387553d3fa22b0","observation_id":"bea2d9d4-7d88-4146-aa9d-cedd59fb6d4f","resolution":{"observed_at":"2026-08-10T22:25:54.622364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04249","last_updated":"2024-02-27T04:43:08Z","snapshot_observed_at":"2026-08-16T09:07:20.265665Z","submitted_at":"2024-02-06T18:59:08Z","title":"HarmBench: A Standardized Evaluation Framework for Automated Red Teaming and Robust Refusal","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04249","snapshot_observed_at":"2026-08-10T22:25:54.626108Z","title":"Harmbench: A standardized evaluation framework for automated red teaming and robust refusal, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.626108Z"},"links":{"cited_paper":"/paper/2402.04249","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:962e5eca23fdc3b92842c055510c935245dbf94027ab050e802bfafae8bfe6cc","observation_id":"073d849e-b3b5-4fd2-aeab-9f9812d9b6c0","resolution":{"observed_at":"2026-08-10T22:25:54.626108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-16T14:37:45.469470Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-10T22:25:54.629811Z","title":"Tree of attacks: Jailbreaking black-box llms automatically, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.629811Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:a902f31f3553f9d3622534f5f421acc784d5dde9e01552d51e350b2f8dfe9076","observation_id":"6bce1429-58d2-491f-9b37-af18e798a38c","resolution":{"observed_at":"2026-08-10T22:25:54.629811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.399755Z","title":"Llama guard 2 | model cards and prompt formats, 2024","venue":null,"work_id":"b05e8f76-541c-4b82-8e32-a6f442bae2ee","year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.633549Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:4eb70059dc9df93a47e92b1b9d191e7ca821cf1dc3a7370c0284c918eb415254","observation_id":"ad92feb0-3244-4c29-ac55-e8b1f6d86561","resolution":{"observed_at":"2026-08-10T22:25:55.404103Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04373","last_updated":"2023-10-10T15:01:11Z","snapshot_observed_at":"2026-08-16T14:54:24.706600Z","submitted_at":"2023-10-06T16:59:17Z","title":"Confronting Reward Model Overoptimization with Constrained RLHF","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04373","snapshot_observed_at":"2026-08-10T22:25:54.637458Z","title":"K., Strouse, D., Sandholm, T., Salakhutdinov, R., Dragan, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.637458Z"},"links":{"cited_paper":"/paper/2310.04373","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:8fd484e0d7d5a0397f1a6e2df98419e18dd9a21a332e64a8f2f32d4fca16f792","observation_id":"4ee6e890-3707-4d2a-97bc-e159ea09e38c","resolution":{"observed_at":"2026-08-10T22:25:54.637458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.386145Z","title":"Y., Harada, D., and Russell, S","venue":null,"work_id":"c54af8fa-97fa-4675-b6ec-bca03b264fe3","year":1999},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.641722Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:03d97dfdf3c29cdfbfdce3dc18dc889d85fd83bc08a02d070d62773fb90c456d","observation_id":"6d6f5143-5a1a-477c-9f37-550e43f7c0c0","resolution":{"observed_at":"2026-08-10T22:25:55.390523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24096","last_updated":"2024-10-31T16:28:33Z","snapshot_observed_at":"2026-08-16T13:04:04.935390Z","submitted_at":"2024-10-31T16:28:33Z","title":"Progressive Safeguards for Safe and Model-Agnostic Reinforcement Learning","version":1},"cited_work":{"arxiv_id":"2410.24096","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.24096","snapshot_observed_at":"2026-08-10T22:25:55.027196Z","title":"Progressive Safeguards for Safe and Model-Agnostic Reinforcement Learning","venue":"cs.LG","work_id":"94041b3c-7081-4430-8919-9363c94df660","year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.645755Z"},"links":{"cited_paper":"/paper/2410.24096","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:b34a0c8afec6721f72bdddec369c3959f04be8826a6d68482bca297abbe632de","observation_id":"80a06231-a5e6-408d-9827-1f7dd82d3ddf","resolution":{"observed_at":"2026-08-10T22:25:55.034791Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T22:25:54.650079Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.650079Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:0811bc372c570b3a6722f359f9e859735ced3a4b24de219e8f4eb2940d09bbeb","observation_id":"e2c2213d-6dac-459b-93f4-fb6c9dee3adb","resolution":{"observed_at":"2026-08-10T22:25:54.650079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-08-15T19:46:54.909325Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-10T22:25:54.654401Z","title":"Red teaming language models with language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.654401Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:598afed65b47358a96e870cd4511916a0fe6d1e17f70ac94ce50fcac570be400","observation_id":"d9476fc3-7504-46bb-9d58-78762d1b8bc1","resolution":{"observed_at":"2026-08-10T22:25:54.654401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12798","last_updated":"2024-09-19T14:08:09Z","snapshot_observed_at":"2026-08-16T13:17:09.561969Z","submitted_at":"2024-09-19T14:08:09Z","title":"Assessing the Zero-Shot Capabilities of LLMs for Action Evaluation in RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12798","snapshot_observed_at":"2026-08-10T22:25:54.659473Z","title":"Assessing the zero-shot capabilities of llms for action evaluation in rl, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.659473Z"},"links":{"cited_paper":"/paper/2409.12798","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:4bb56245a3dee051f02c154e35726e80d07b6503ba7eacda2817826bb5b008e5","observation_id":"f826c524-d33b-42b0-b6ae-e216afddb3ec","resolution":{"observed_at":"2026-08-10T22:25:54.659473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05946","last_updated":"2024-06-10T00:35:23Z","snapshot_observed_at":"2026-08-16T13:44:42.428829Z","submitted_at":"2024-06-10T00:35:23Z","title":"Safety Alignment Should Be Made More Than Just a Few Tokens Deep","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05946","snapshot_observed_at":"2026-08-10T22:25:54.663803Z","title":"Safety alignment should be made more than just a few tokens deep, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.663803Z"},"links":{"cited_paper":"/paper/2406.05946","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:ab475e6f2653031b23e728d3fac53071663a78db459560c9fb8adb3c2325cb1f","observation_id":"eaa6c832-81be-4895-8a91-dfc5d842476d","resolution":{"observed_at":"2026-08-10T22:25:54.663803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.04628","last_updated":"2022-02-13T21:23:07Z","snapshot_observed_at":"2026-08-16T17:22:27.661674Z","submitted_at":"2022-02-09T18:45:40Z","title":"Reinforcement Learning with Sparse Rewards using Guidance from Offline Demonstration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.04628","snapshot_observed_at":"2026-08-10T22:25:54.668146Z","title":"Reinforcement learning with sparse rewards using guidance from offline demonstration, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.668146Z"},"links":{"cited_paper":"/paper/2202.04628","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:63a396d24b8b617843f27a38ad4d2f315b2eb74ef480a5fef5ae8a6efe919957","observation_id":"550403b8-cf75-4ab9-8269-7248486d1546","resolution":{"observed_at":"2026-08-10T22:25:54.668146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.16822","last_updated":"2024-12-11T18:07:25Z","snapshot_observed_at":"2026-08-16T14:15:11.780356Z","submitted_at":"2024-02-26T18:47:27Z","title":"Rainbow Teaming: Open-Ended Generation of Diverse Adversarial Prompts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.16822","snapshot_observed_at":"2026-08-10T22:25:54.672598Z","title":"C., Lupu, A., Hambro, E., Markosyan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.672598Z"},"links":{"cited_paper":"/paper/2402.16822","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:e36fa4d5d98ebe8bd1902722b988cc373e52e5b142b3005cdf19d7103049523e","observation_id":"dd77d7f6-02ec-4205-8652-27790d29f87f","resolution":{"observed_at":"2026-08-10T22:25:54.672598Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1707.06347","last_updated":"2017-08-28T09:20:06Z","snapshot_observed_at":"2026-08-15T20:26:32.102285Z","submitted_at":"2017-07-20T02:32:33Z","title":"Proximal Policy Optimization Algorithms","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1707.06347","snapshot_observed_at":"2026-08-10T22:25:54.676911Z","title":"Proximal policy optimization algorithms, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.676911Z"},"links":{"cited_paper":"/paper/1707.06347","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:7504507370f9af710e7340ba51618b5c469f9f9119a08bd25f1bda8577691591","observation_id":"0315ce1b-7d2a-4f4a-bfce-19e19a41e7f7","resolution":{"observed_at":"2026-08-10T22:25:54.676911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03825","last_updated":"2024-05-15T12:06:31Z","snapshot_observed_at":"2026-08-16T09:32:10.049300Z","submitted_at":"2023-08-07T16:55:20Z","title":"\"Do Anything Now\": Characterizing and Evaluating In-The-Wild Jailbreak Prompts on Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03825","snapshot_observed_at":"2026-08-10T22:25:54.681275Z","title":"do anything now","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.681275Z"},"links":{"cited_paper":"/paper/2308.03825","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:8b5f5176fd6a570928cfc4af42a56570248c367d61415da9eb02f1806b0e15a9","observation_id":"fe7272cc-c41b-4c30-969b-76a4876ea625","resolution":{"observed_at":"2026-08-10T22:25:54.681275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.15980","last_updated":"2020-11-07T05:33:35Z","snapshot_observed_at":"2026-08-16T19:09:26.533311Z","submitted_at":"2020-10-29T22:54:00Z","title":"AutoPrompt: Eliciting Knowledge from Language Models with Automatically Generated Prompts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.15980","snapshot_observed_at":"2026-08-10T22:25:54.685378Z","title":"L., Wallace, E., and Singh, S","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.685378Z"},"links":{"cited_paper":"/paper/2010.15980","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:449306e0bfa84dda76820375a673c1357c50683ff0be50a94d4855f2a9a48264","observation_id":"bdf49c32-6e8c-41cb-b37a-63fb5ef6cb84","resolution":{"observed_at":"2026-08-10T22:25:54.685378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.04200","last_updated":"2021-07-09T04:24:40Z","snapshot_observed_at":"2026-08-16T18:11:15.220288Z","submitted_at":"2021-07-09T04:24:40Z","title":"Safe Exploration by Solving Early Terminated MDP","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.04200","snapshot_observed_at":"2026-08-10T22:25:54.689496Z","title":"Safe exploration by solving early terminated mdp, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.689496Z"},"links":{"cited_paper":"/paper/2107.04200","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:953ef75cd4e7e4bc6db9c04047c374f7fe03ba5bce3e2d5fc2beb92821f19063","observation_id":"32738862-ddf9-48b6-9a89-e9cb41d4b104","resolution":{"observed_at":"2026-08-10T22:25:54.689496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.693893Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.693893Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:ca79909a8256b551ba606088b97236e9863b5c0d60979258589b04d11a2b6b7c","observation_id":"479ea283-8c1d-410a-bb8a-13a388053e3d","resolution":{"observed_at":"2026-08-10T22:25:54.693893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-10T22:25:54.697793Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahriari, B., Ramé, A., Ferret, J., Liu, P., Tafti, P., Friesen, A., Casbon, M., Ramos, S., Kumar, R., Lan, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.697793Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:73d2ac926651816538ac0e6765d5d6767b01384a0633e85ea549be3fe88f7249","observation_id":"b2569346-1b70-414f-878c-29b61a9617cc","resolution":{"observed_at":"2026-08-10T22:25:54.697793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:55.363615Z","title":"Introducing qwen1.5, February 2024 a","venue":null,"work_id":"e5de2311-d4fb-47e9-9e47-95cde80c9772","year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.702261Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:864e77a87c2cba7bb6a9da8846ee9c0630268238fa1636a832b5c80442289b66","observation_id":"4029d34d-89d5-450b-9cdc-7952b4876c86","resolution":{"observed_at":"2026-08-10T22:25:55.367954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:25:54.706303Z","title":"Qwen2.5: A party of foundation models, September 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.706303Z"},"links":{"citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:908180c76ff76723c8b7c9900fa357c523f7b5b8f29b10242d38de33b004d039","observation_id":"692e3707-cf9c-4a5d-9b3f-027d9131e0cf","resolution":{"observed_at":"2026-08-10T22:25:54.706303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.02990","last_updated":"2021-01-24T09:49:19Z","snapshot_observed_at":"2026-08-11T03:00:50.262052Z","submitted_at":"2020-04-06T20:44:10Z","title":"Evaluating the Evaluation of Diversity in Natural Language Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.02990","snapshot_observed_at":"2026-08-10T22:25:54.710403Z","title":"and Berant, J","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.710403Z"},"links":{"cited_paper":"/paper/2004.02990","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:1ebeac4d0ba80b15d9024829133ff663e15e2dc6ea25b9e06c9770ae471d6626","observation_id":"cefe18f5-dce9-4093-93f0-f8042d9544df","resolution":{"observed_at":"2026-08-10T22:25:54.710403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T22:25:54.714466Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.714466Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:c5ae8fa06b53114af5544a461426f0ea7b704e5bf4fc864ca5d39420f5b8eaa7","observation_id":"f270f410-fcbe-4947-92c6-6ff9dae2b282","resolution":{"observed_at":"2026-08-10T22:25:54.714466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-15T09:26:05.847971Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-10T22:25:54.718218Z","title":"M., and Wolf, T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.718218Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:9d9bcc47a0db204a0894ec27fdc969438b40ccdfef6082bc456c8f1bcfed35da","observation_id":"7cb9c10c-5dc6-46f0-a20a-d7a3b3c5e334","resolution":{"observed_at":"2026-08-10T22:25:54.718218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-10T22:25:54.723257Z","title":"Jailbreak and guard aligned language models with only few in-context demonstrations, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.723257Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:d17aeddafc6ca82595ff7c91a1d21f12e060d3b350caf6921c9b6657436c54b7","observation_id":"962b564d-6ac9-41c1-8db9-b5cc36a03762","resolution":{"observed_at":"2026-08-10T22:25:54.723257Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06373","last_updated":"2024-01-23T22:46:12Z","snapshot_observed_at":"2026-08-16T14:27:54.649783Z","submitted_at":"2024-01-12T16:13:24Z","title":"How Johnny Can Persuade LLMs to Jailbreak Them: Rethinking Persuasion to Challenge AI Safety by Humanizing LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06373","snapshot_observed_at":"2026-08-10T22:25:54.727702Z","title":"How johnny can persuade llms to jailbreak them: Rethinking persuasion to challenge ai safety by humanizing llms, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.727702Z"},"links":{"cited_paper":"/paper/2401.06373","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:ff483d97a29f6576f60cd64012fd17a2abc1809ed5dc78c0f69e67ef8db6e4a4","observation_id":"635fe8bb-f7b9-4652-83da-4eee64fdb1a3","resolution":{"observed_at":"2026-08-10T22:25:54.727702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.19026","last_updated":"2024-12-20T07:37:32Z","snapshot_observed_at":"2026-08-16T13:48:13.756766Z","submitted_at":"2024-05-29T12:12:09Z","title":"DiveR-CT: Diversity-enhanced Red Teaming Large Language Model Assistants with Relaxing Constraints","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.19026","snapshot_observed_at":"2026-08-10T22:25:54.731944Z","title":"Diver-ct: Diversity-enhanced red teaming with relaxing constraints, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.731944Z"},"links":{"cited_paper":"/paper/2405.19026","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:391cf6484aa9129e73f6663af384553cbf0a1115b904ef962c461245390ae409","observation_id":"49a057db-d875-41b0-9169-d4bd65c026ff","resolution":{"observed_at":"2026-08-10T22:25:54.731944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01850","last_updated":"2024-07-01T23:25:30Z","snapshot_observed_at":"2026-08-16T13:37:56.090609Z","submitted_at":"2024-07-01T23:25:30Z","title":"Purple-teaming LLMs with Adversarial Defender Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01850","snapshot_observed_at":"2026-08-10T22:25:54.735983Z","title":"Purple-teaming llms with adversarial defender training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.735983Z"},"links":{"cited_paper":"/paper/2407.01850","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:40bdcd68c8da1e4b0b415fc8338eda5f4b741752aa7922ff00ec91799f3dde93","observation_id":"6df875c8-52c5-4bb8-91f3-6c76500f792e","resolution":{"observed_at":"2026-08-10T22:25:54.735983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-10T22:25:54.739885Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T22:25:54.739885Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2501.01830"},"observation_digest":"sha256:1fc0e8a853223e03c4b7067ef31e7e7ffa009cb221bf35e132b779df6dd73663","observation_id":"16d9dbb0-fdd1-4a1a-af52-3026d4b2d7b3","resolution":{"observed_at":"2026-08-10T22:25:54.739885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01830","last_updated":"2025-01-03T14:30:14Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-15T00:57:40.328423Z","submitted_at":"2025-01-03T14:30:14Z","title":"Auto-RT: Automatic Jailbreak Strategy Exploration for Red-Teaming Large Language Models"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":44,"verified_exact":1,"verified_fuzzy":8},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 8 inbound Pith citation observations for arXiv:2501.01830."}