{"as_of":"2026-08-19T01:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:fc37f0cb17ef04fa2deef4043131d48e872338d664c3367c6ad8712a5129a80f","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:50:25.717337Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T01:28:07.221590Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T18:55:58.422476Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2604.11309","last_updated":"2026-04-13T11:12:30Z","snapshot_observed_at":"2026-08-10T14:33:23.383610Z","submitted_at":"2026-04-13T11:12:30Z","title":"The Salami Slicing Threat: Exploiting Cumulative Risks in LLM Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-10T16:07:31.602378Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2604.11309"},"observation_digest":"sha256:030b56831dc72f3995562a49dad70a52c876638df8f74914b6f3556d28551475","observation_id":"15d0bef9-8dc8-4ab5-a86e-a1d3216ca85b","resolution":{"observed_at":"2026-05-11T09:16:04.380533Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2605.08277","last_updated":"2026-05-08T06:33:42Z","snapshot_observed_at":"2026-08-15T22:50:18.166049Z","submitted_at":"2026-05-08T06:33:42Z","title":"Mitigating Many-shot Jailbreak Attacks with One Single Demonstration","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T00:50:19.648405Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2605.08277"},"observation_digest":"sha256:52136a5c0be2413d51b41765c0739ee7516158ed8504a5645e147ceb23e2b311","observation_id":"ad50daed-644a-472a-93fc-0ab8ed1ea288","resolution":{"observed_at":"2026-05-12T00:51:14.989743Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2605.16471","last_updated":"2026-05-15T13:53:02Z","snapshot_observed_at":"2026-08-14T00:09:46.311940Z","submitted_at":"2026-05-15T13:53:02Z","title":"From AI-Generated Content to Agentic Action: Security and Safety Threats in Generative AI","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-20T18:08:24.901025Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2605.16471"},"observation_digest":"sha256:cf6a40cd80ffe2ae6c600acf238a5015dd4a5bfc8a6edd55454e7eb092e5d941","observation_id":"bcb86915-e183-4ac1-a23d-d2f1285ca74b","resolution":{"observed_at":"2026-05-20T18:08:50.541169Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"cited_work":{"arxiv_id":"2507.02956","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02956","snapshot_observed_at":"2026-07-01T18:55:58.422476Z","title":"A representation engineering perspective on the effectiveness of multi-turn jailbreaks","venue":null,"work_id":"04866448-32b7-490e-b526-29d6b742c7df","year":2025},"citing_paper":{"arxiv_id":"2606.27567","last_updated":"2026-06-25T21:52:29Z","snapshot_observed_at":"2026-08-14T23:51:32.293780Z","submitted_at":"2026-06-25T21:52:29Z","title":"On the Inseparability of Instructions and Data in Shared-Embedding Sequence Models","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T01:28:07.221590Z"},"links":{"cited_paper":"/paper/2507.02956","citing_paper":"/paper/2606.27567"},"observation_digest":"sha256:49dee6edb9263cb0b2a5db8310677b0d2cdf3f2735e3a794e13b907804c5b079","observation_id":"889f0505-845f-4f7d-b10c-838f7a34905f","resolution":{"observed_at":"2026-07-01T18:55:58.424358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02956/citation-record","integrity":"/paper/2507.02956/integrity","json":"/paper/2507.02956/citation-record.json","paper":"/paper/2507.02956"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:23.638511Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.638511Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:885f0cfe11abfdc57f00ec9ebe51a4bf713df2524f86f328f07dc65954a4f9bf","observation_id":"8c3456ac-1348-47f6-a910-eef0958bb212","resolution":{"observed_at":"2026-08-06T21:50:23.638511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.03131","last_updated":"2024-09-10T21:53:46Z","snapshot_observed_at":"2026-08-18T23:11:16.593820Z","submitted_at":"2024-09-04T23:45:10Z","title":"Well, that escalated quickly: The Single-Turn Crescendo Attack (STCA)","version":2},"cited_work":{"arxiv_id":"2409.03131","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.03131","snapshot_observed_at":"2026-08-06T21:50:26.234402Z","title":"Well, that escalated quickly: The Single-Turn Crescendo Attack (STCA)","venue":"cs.CR","work_id":"ba503ba0-8f64-49ca-a101-c56758fda13d","year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.682275Z"},"links":{"cited_paper":"/paper/2409.03131","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:d1b34dba4c34fe7416e56c3344ec274fdbbabbff2bddb1e1a812a05b36fc3839","observation_id":"476c410e-88e4-4910-9937-32e74c627486","resolution":{"observed_at":"2026-08-06T21:50:26.290852Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:50:23.718505Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback, 2022 a","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.718505Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:63149a8bd83c55bfbe0dcfe3c73c71ed516e88dd791fae68577213723bf6f480","observation_id":"8d36f44d-8bb5-4879-9bdf-42d0bc633329","resolution":{"observed_at":"2026-08-06T21:50:23.718505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-16T03:49:00.703994Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-06T21:50:23.813973Z","title":"E., Fort, S., Lanham, T., Telleen-Lawton, T., Conerly, T., Henighan, T., Hume, T., Bowman, S","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.813973Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c8d3d7e62eed571fd0ff872e350c361608f9aed6fe3451c678ebc135675e4dbf","observation_id":"4b4a4ebe-5b5e-4188-87ae-6913e3b6696e","resolution":{"observed_at":"2026-08-06T21:50:23.813973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-06T21:50:23.931047Z","title":"J., and Wong, E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:23.931047Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:4b19401947d227a4eb8fa7ea7879863ae7197f8f65792b4afdc3a489276102f9","observation_id":"cedc3e42-4251-41be-abd5-a43435295f02","resolution":{"observed_at":"2026-08-06T21:50:23.931047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T21:50:24.041051Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.041051Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:9c6a83049ed9c9721d8fc26ffadd0cd96199893a86bd4f4634a2819706666845","observation_id":"c45739ee-df9e-4c02-9caf-85f8fda83311","resolution":{"observed_at":"2026-08-06T21:50:24.041051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16339","last_updated":"2025-01-08T20:11:59Z","snapshot_observed_at":"2026-08-17T07:21:20.458339Z","submitted_at":"2024-12-20T21:00:11Z","title":"Deliberative Alignment: Reasoning Enables Safer Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16339","snapshot_observed_at":"2026-08-06T21:50:24.108617Z","title":"Y., Joglekar, M., Wallace, E., Jain, S., Barak, B., Helyar, A., Dias, R., Vallone, A., Ren, H., Wei, J., Chung, H","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.108617Z"},"links":{"cited_paper":"/paper/2412.16339","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:6de371e32a8270ad10e0141941a2dcc04cd44971eb307d06e2fb17edd7d25f52","observation_id":"d78fe336-7b68-4781-a6de-0a99ff02065d","resolution":{"observed_at":"2026-08-06T21:50:24.108617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08679","last_updated":"2024-06-07T00:13:08Z","snapshot_observed_at":"2026-08-16T14:18:53.099186Z","submitted_at":"2024-02-13T18:58:48Z","title":"COLD-Attack: Jailbreaking LLMs with Stealthiness and Controllability","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08679","snapshot_observed_at":"2026-08-06T21:50:24.189376Z","title":"Cold-attack: Jailbreaking llms with stealthiness and controllability, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.189376Z"},"links":{"cited_paper":"/paper/2402.08679","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:92b9b68eb1093ce24e3a1212cdefb3eb1702dae96f5e334e87c6388ac85e31c9","observation_id":"eba21bb8-2c2f-4933-94eb-e0b8a11402c2","resolution":{"observed_at":"2026-08-06T21:50:24.189376Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:24.261948Z","title":"Steering dialogue dynamics for robustness against multi-turn jailbreaking attacks, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.261948Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:ba4a25eea284696f60d9cc0c6adec5e9d2d6e39994d74e242c176de8858e32bc","observation_id":"87a9aac9-c8c8-44dc-a605-a480afb89877","resolution":{"observed_at":"2026-08-06T21:50:24.261948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15221","last_updated":"2024-09-04T00:58:59Z","snapshot_observed_at":"2026-08-16T13:23:25.577041Z","submitted_at":"2024-08-27T17:33:30Z","title":"LLM Defenses Are Not Robust to Multi-Turn Human Jailbreaks Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15221","snapshot_observed_at":"2026-08-06T21:50:24.381051Z","title":"Llm defenses are not robust to multi-turn human jailbreaks yet, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.381051Z"},"links":{"cited_paper":"/paper/2408.15221","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:3d7e466e9fa28684b20a53ae5346e4b1be4506876af74929119d4f6797769df7","observation_id":"c6e2f740-a3b4-4596-b545-b38fd8c10bda","resolution":{"observed_at":"2026-08-06T21:50:24.381051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:24.501823Z","title":"X-boundary: Establishing exact safety boundary to shield llms from multi-turn jailbreaks without compromising usability, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.501823Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:96612e8944f0cad462634426f252beed4b0dcc8f49e072931bc31ab9abafdf4e","observation_id":"218f2879-44f5-42f8-b73c-0f0c7aae61c5","resolution":{"observed_at":"2026-08-06T21:50:24.501823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-18T18:32:32.343266Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-06T21:50:24.594454Z","title":"Tree of attacks: Jailbreaking black-box llms automatically, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.594454Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:26f03dcb3a184cb262be5e031826c28faae095ff4c01924a49283758b2a0ded3","observation_id":"ca0ad785-49d1-417c-ab53-21df10b7f92d","resolution":{"observed_at":"2026-08-06T21:50:24.594454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02828","last_updated":"2024-10-01T17:00:59Z","snapshot_observed_at":"2026-08-16T13:13:39.441447Z","submitted_at":"2024-10-01T17:00:59Z","title":"PyRIT: A Framework for Security Risk Identification and Red Teaming in Generative AI System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02828","snapshot_observed_at":"2026-08-06T21:50:24.688041Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.688041Z"},"links":{"cited_paper":"/paper/2410.02828","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:41e5940ecc95fba4025ae19b344369979742231d87c375bc23ec39236bc0fbe5","observation_id":"3a8ce7cb-43d4-49a9-9712-bc9a094941ff","resolution":{"observed_at":"2026-08-06T21:50:24.688041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01606","last_updated":"2024-10-02T14:47:05Z","snapshot_observed_at":"2026-08-19T00:20:49.180545Z","submitted_at":"2024-10-02T14:47:05Z","title":"Automated Red Teaming with GOAT: the Generative Offensive Agent Tester","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01606","snapshot_observed_at":"2026-08-06T21:50:24.807231Z","title":"C., Evtimov, I., and Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.807231Z"},"links":{"cited_paper":"/paper/2410.01606","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:cf5b9e790cc600b00a4ce723972d57083747f9e8b16d288c81dc5afff6255f38","observation_id":"de570d9d-cb13-4aed-84ad-1348293e97ca","resolution":{"observed_at":"2026-08-06T21:50:24.807231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01833","last_updated":"2025-02-26T13:41:41Z","snapshot_observed_at":"2026-08-13T05:33:18.631487Z","submitted_at":"2024-04-02T10:45:49Z","title":"Great, Now Write an Article About That: The Crescendo Multi-Turn LLM Jailbreak Attack","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01833","snapshot_observed_at":"2026-08-06T21:50:24.901579Z","title":"Great, now write an article about that: The crescendo multi-turn llm jailbreak attack, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:24.901579Z"},"links":{"cited_paper":"/paper/2404.01833","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:09cbcfc4cdc09b1c70a8a3354e44ae1e39e5cfdba4690033b6eb1edcec5c681c","observation_id":"986520c3-098d-47ef-84fd-10564fb86639","resolution":{"observed_at":"2026-08-06T21:50:24.901579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09063","last_updated":"2025-04-16T15:15:56Z","snapshot_observed_at":"2026-08-16T14:18:42.489920Z","submitted_at":"2024-02-14T10:20:03Z","title":"Soft Prompt Threats: Attacking Safety Alignment and Unlearning in Open-Source LLMs through the Embedding Space","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09063","snapshot_observed_at":"2026-08-06T21:50:25.052460Z","title":"Soft prompt threats: Attacking safety alignment and unlearning in open-source llms through the embedding space, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.052460Z"},"links":{"cited_paper":"/paper/2402.09063","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:a43726606512c6dc322cb5e13b123291401f30180d1fe61129ba8da19e486277","observation_id":"d96455b2-84ed-4436-8021-783c7711c8d1","resolution":{"observed_at":"2026-08-06T21:50:25.052460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-08-08T23:58:18.293467Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-06T21:50:25.121585Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.121585Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:daa929e21f67888579b06054c56a3fb493f894c9bb646653c758101f043e48da","observation_id":"3b287634-43b3-4732-a2ec-965d9f8786e2","resolution":{"observed_at":"2026-08-06T21:50:25.121585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:50:25.217506Z","title":"Taxonomy, opportunities, and challenges of representation engineering for large language models, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.217506Z"},"links":{"citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:b9e25ad06804501300279a161adc51541f1f39c7db4055b316a2e5c3aef57113","observation_id":"3aed3228-bacd-4e80-817f-1acc3b673ee6","resolution":{"observed_at":"2026-08-06T21:50:25.217506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01550","last_updated":"2025-07-15T02:52:56Z","snapshot_observed_at":"2026-08-16T12:44:39.341941Z","submitted_at":"2025-04-02T09:47:01Z","title":"Representation Bending for Large Language Model Safety","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01550","snapshot_observed_at":"2026-08-06T21:50:25.299707Z","title":"S., Lee, S., Jeung, W., Han, S., Wan, A., Ngan, H., Yu, Y., and Choi, J","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.299707Z"},"links":{"cited_paper":"/paper/2504.01550","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:656c997a93b1349958462125f3916f41099a0750a578b07b99e189377f89a8e0","observation_id":"6a125ad1-e518-4342-b435-8c35075d0f98","resolution":{"observed_at":"2026-08-06T21:50:25.299707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10619","last_updated":"2025-05-28T09:31:33Z","snapshot_observed_at":"2026-08-18T13:06:50.926469Z","submitted_at":"2025-03-13T17:57:32Z","title":"Tempest: Autonomous Multi-Turn Jailbreaking of Large Language Models with Tree Search","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10619","snapshot_observed_at":"2026-08-06T21:50:25.394358Z","title":"and Arel, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.394358Z"},"links":{"cited_paper":"/paper/2503.10619","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:4d26f2d25d5b85c3fb5a90e1227f1b9bea667faea21c6f7285ae35a3df9d173c","observation_id":"1fb5d3d7-f02d-4e4d-bae5-75e22877ec81","resolution":{"observed_at":"2026-08-06T21:50:25.394358Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-06T21:50:25.505408Z","title":"J., Wang, Z., Mallen, A., Basart, S., Koyejo, S., Song, D., Fredrikson, M., Kolter, J","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.505408Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:c6e8702db3c8c0099024c3f608cd89cb6db93b2ae0519df2f2927e754f5708de","observation_id":"9ec2eda3-b55d-4171-9724-fd207bff6ccd","resolution":{"observed_at":"2026-08-06T21:50:25.505408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-06T21:50:25.591506Z","title":"Z., and Fredrikson, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.591506Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:6066b6cfe72b5e3f97ce47ad2111a0855b86f6348eccb74914deb3a748e4eb84","observation_id":"cc2a659d-dbc5-46c1-9da7-b01d1cc11c60","resolution":{"observed_at":"2026-08-06T21:50:25.591506Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04313","last_updated":"2024-07-12T16:51:07Z","snapshot_observed_at":"2026-08-16T13:45:24.998996Z","submitted_at":"2024-06-06T17:57:04Z","title":"Improving Alignment and Robustness with Circuit Breakers","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04313","snapshot_observed_at":"2026-08-06T21:50:25.717337Z","title":"Improving alignment and robustness with circuit breakers, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T21:50:25.717337Z"},"links":{"cited_paper":"/paper/2406.04313","citing_paper":"/paper/2507.02956"},"observation_digest":"sha256:43d0f5423b64d1443df78a0cd11db37c7c98ab865d50576bae37dcf8f3130008","observation_id":"b01ed218-98a2-470d-8d2b-fde3eb6d002b","resolution":{"observed_at":"2026-08-06T21:50:25.717337Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.02956","last_updated":"2025-06-29T23:28:55Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-18T02:19:50.093237Z","submitted_at":"2025-06-29T23:28:55Z","title":"A Representation Engineering Perspective on the Effectiveness of Multi-Turn Jailbreaks"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":22,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 4 inbound Pith citation observations for arXiv:2507.02956."}