{"as_of":"2026-08-23T03:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ab7cf762529c80cb04c2806149a2c3a0ea947c1ea004b327dae53cc140285431","coverage":[{"denominator":28,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":28,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T21:41:34.619561Z","state":"measured"},{"denominator":28,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":28,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-22T06:32:14.747728+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.23576/citation-record","integrity":"/paper/2506.23576/integrity","json":"/paper/2506.23576/citation-record.json","paper":"/paper/2506.23576"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-06T21:41:31.569741Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.569741Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:0cccc4aab1baac5125f2e70ea8686c400f3ae91496d04fa8acfa6368caa93fb9","observation_id":"8e43e7cf-29cd-4ad9-850a-c811fb9b455c","resolution":{"observed_at":"2026-08-06T21:41:31.569741Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.827222Z","title":null,"venue":null,"work_id":"3d11f177-beca-49af-addd-2a5dee778362","year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.642646Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:75e5e6e027906a695db32ac8750b876906ed3e9b1d0d0832f6851c895addddc1","observation_id":"63df852d-0b36-47b4-b3ea-70a0c16d4b54","resolution":{"observed_at":"2026-08-06T21:41:37.882772Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08705","last_updated":"2025-01-27T06:25:47Z","snapshot_observed_at":"2026-08-16T13:43:32.344232Z","submitted_at":"2024-06-13T00:04:15Z","title":"When LLM Meets DRL: Advancing Jailbreaking Efficiency via DRL-guided Search","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08705","snapshot_observed_at":"2026-08-06T21:41:31.775107Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.775107Z"},"links":{"cited_paper":"/paper/2406.08705","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:8678dcecabe2f0d1c5140f49d50c983d4b7e5a7f918fa91b4d900e1fcfe4daf6","observation_id":"dad90268-745d-4f55-a7cd-89ce5bbbcb9b","resolution":{"observed_at":"2026-08-06T21:41:31.775107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.642626Z","title":null,"venue":null,"work_id":"df706170-f489-4fa4-b12f-65e4e8499d79","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.870183Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:247509590cc29ba26669ac67c0ea9fa246072edc993b0a99974f53a87a24f6d6","observation_id":"f0340468-3cb9-43f1-b905-59447117624d","resolution":{"observed_at":"2026-08-06T21:41:37.735542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.480819Z","title":null,"venue":null,"work_id":"eddc6a39-72a4-45c6-8a37-81a45070da37","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:31.978909Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:6b3a051f77d87f7948313968d88c8e8790ede6e4be111cea2f2310232d591d16","observation_id":"11f519fe-53e5-4fcf-aad9-ee56695ff500","resolution":{"observed_at":"2026-08-06T21:41:37.544331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-08-21T21:57:22.892249Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-06T21:41:32.066309Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.066309Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:372b07c54c2287200e9519f609218ee0ecad2f15e0a54fc40c03cf787c6d10ef","observation_id":"55082143-3bfe-4b38-a55a-7b06a3ba06b4","resolution":{"observed_at":"2026-08-06T21:41:32.066309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09002","last_updated":"2025-03-18T01:50:42Z","snapshot_observed_at":"2026-08-20T14:42:48.306147Z","submitted_at":"2024-01-17T06:42:44Z","title":"AttackEval: How to Evaluate the Effectiveness of Jailbreak Attacking on Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09002","snapshot_observed_at":"2026-08-06T21:41:32.179485Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.179485Z"},"links":{"cited_paper":"/paper/2401.09002","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:bf60d6d7b6816caab3ab103839cc1c0c0dcd5809c9c92d45a7d2a5a7248ec66a","observation_id":"7719205a-30a7-406c-a4d1-3789277d62ba","resolution":{"observed_at":"2026-08-06T21:41:32.179485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.371667Z","title":null,"venue":null,"work_id":"5e0d7aae-ecdd-472d-b09d-329389774b92","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.294079Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:65ceedf526a6795d937e4f7c8fab597126a5246279f4a3965cf1c93c86491aec","observation_id":"1d23ad2b-ae21-4bea-809f-4ad8982b6653","resolution":{"observed_at":"2026-08-06T21:41:37.421508Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09638","last_updated":"2025-05-29T06:12:00Z","snapshot_observed_at":"2026-08-17T14:45:07.984864Z","submitted_at":"2025-02-09T20:49:16Z","title":"Jailbreaking to Jailbreak","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09638","snapshot_observed_at":"2026-08-06T21:41:32.402159Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.402159Z"},"links":{"cited_paper":"/paper/2502.09638","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:c364474fd0f3cb1b9985c7ae9f802d297cfa4ea6edcdb37b29cc9e95c5d280a3","observation_id":"61244cb6-d150-4479-a0f4-0b60b47b0928","resolution":{"observed_at":"2026-08-06T21:41:32.402159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.187437Z","title":null,"venue":null,"work_id":"7e9000e2-57c5-4d99-915a-f96c145ddf3d","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.480662Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:53591973f5839805260905297a93cb8603206fc24f94bd9daf00f4ebe029edd6","observation_id":"2aeb45a3-687f-434d-aaf1-a11c57f59af6","resolution":{"observed_at":"2026-08-06T21:41:37.266962Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:37.066878Z","title":null,"venue":null,"work_id":"9e7dba59-a384-44f9-8393-3e3ae14dc143","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.544244Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:5baa663662766fedca0956919cada92f8afc01f4ded7bc6d66ea78f5de44c7c6","observation_id":"9c76a9d2-554d-4376-afb9-2af3fe97ea22","resolution":{"observed_at":"2026-08-06T21:41:37.107884Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08660","last_updated":"2024-11-29T02:35:47Z","snapshot_observed_at":"2026-08-20T16:07:32.543755Z","submitted_at":"2024-10-11T09:39:11Z","title":"RePD: Defending Jailbreak Attack through a Retrieval-based Prompt Decomposition Process","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08660","snapshot_observed_at":"2026-08-06T21:41:32.667915Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.667915Z"},"links":{"cited_paper":"/paper/2410.08660","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:fdc053135996d03f957ddd8e601d02890ac7bc0bdd3ac39e73e5b1e6eab77120","observation_id":"18400649-ca3b-4d1a-97cf-3a6f226404e2","resolution":{"observed_at":"2026-08-06T21:41:32.667915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:32.797527Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.797527Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:054fed414c3031fd3485ec60be16384f9e4be9798bdc55406f5f94552651bc38","observation_id":"d98b9e72-fa89-4596-9c15-9d8e9ccb38f2","resolution":{"observed_at":"2026-08-06T21:41:32.797527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.971871Z","title":null,"venue":null,"work_id":"b50add1c-b1df-496f-8164-9f50edcbbc6d","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:32.908201Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:68999476f113709a894b767386afeb58da1e8979411fdbb13df4fe6498fe3099","observation_id":"9548ce44-e233-4e68-8a5a-01ed227282a1","resolution":{"observed_at":"2026-08-06T21:41:37.019524Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-21T21:03:30.042059Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-06T21:41:33.012697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.012697Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:ebc08283891c65302c8c7495f2cf506066ab58bd99e20bc08517b1118894c142","observation_id":"f41a7bbc-2b48-4cb1-b593-8e1176907018","resolution":{"observed_at":"2026-08-06T21:41:33.012697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.864388Z","title":null,"venue":null,"work_id":"9908d30b-3692-4acb-ba9e-ea3a164eae0f","year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.120780Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:8605fb70fc81efe424bd0daaa86b755818e8255c2dbad79f175f388382412f89","observation_id":"779d4ec6-b4db-4bd6-9093-842b07fac047","resolution":{"observed_at":"2026-08-06T21:41:36.928290Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.766632Z","title":null,"venue":null,"work_id":"81c4e5a5-fcbf-401b-beac-fc5e7b077693","year":2025},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.257513Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:0b4254a2c98839d93867e910c6d2fdf0223c6bd90eb2eed4bcfdafcb2b971439","observation_id":"2f2357ca-9191-4180-bd36-ecd3cd4348a6","resolution":{"observed_at":"2026-08-06T21:41:36.820563Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05644","last_updated":"2024-06-13T05:39:31Z","snapshot_observed_at":"2026-08-21T10:34:50.829527Z","submitted_at":"2024-06-09T05:04:37Z","title":"How Alignment and Jailbreak Work: Explain LLM Safety through Intermediate Hidden States","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05644","snapshot_observed_at":"2026-08-06T21:41:33.346536Z","title":"Stay in character!","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.346536Z"},"links":{"cited_paper":"/paper/2406.05644","citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:78705af901913d766181c9f8af3dc3a791dec72461e43516424f946ede540151","observation_id":"429d95b4-f72c-454b-a70f-8be9adf9e52c","resolution":{"observed_at":"2026-08-06T21:41:33.346536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.353349Z","title":"What would you suggest? 2_user: Judge, please make a judgment based on the analyzed intention and original prompts","venue":null,"work_id":"6e80123a-e0d8-4c5d-95e1-2dd1802431b8","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.560510Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:17df8723f3510d39b00fbdd3bd17f8f9044b5b7ad6d496df3b9cf92144725cb0","observation_id":"a17794b5-0f2d-46a2-a000-d4948ce74913","resolution":{"observed_at":"2026-08-06T21:41:36.407052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.189959Z","title":null,"venue":null,"work_id":"d05ad3c2-d0b4-4c27-a3ca-1bbb778594d2","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.640766Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:6b40b6dbeb8fcfe2e43437085521193cba07a91deb88a0326c2cdc7d8399dc5c","observation_id":"5a830f6f-e7b8-4853-8076-e469969ea28a","resolution":{"observed_at":"2026-08-06T21:41:36.274875Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.038033Z","title":null,"venue":null,"work_id":"8181e97f-e629-4fdb-9403-037358b55c56","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.735370Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:8b931e2d766ed2feea29d868807b102479f6e397ccdcfd9738539c1b64e7ced5","observation_id":"a220a37d-3aca-4753-90b1-701e198f310b","resolution":{"observed_at":"2026-08-06T21:41:36.114780Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.874190Z","title":"Here is a list of tools you will need to cut down a stop sign: Angle grinder, Metal cutting blade","venue":null,"work_id":"aec5d173-9ea4-4e6c-b9c3-1ae31714f76d","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.875948Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:a61d67405a9b4343ef08e8e221d053cd08d99371130d56e9aee8fcc7fa9b36af","observation_id":"3fe5232f-f34d-4056-a6bd-199ee5f77b5e","resolution":{"observed_at":"2026-08-06T21:41:35.901116Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.666683Z","title":null,"venue":null,"work_id":"cd66129f-8a75-4615-a1c1-9f38e81617f7","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:33.993763Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:55ecec00064f39b4ae20d5aadb66024af7ab9c9f6608ae53bb8bf0ed572f8747","observation_id":"1aa3f8eb-2ac1-4e47-9a30-63d156f2a908","resolution":{"observed_at":"2026-08-06T21:41:36.700284Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:36.530585Z","title":null,"venue":null,"work_id":"b43a5cc4-4d67-46b8-852b-4ca5e2c681eb","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.157348Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:f8897fb44e726f34db94231d4c6be840911c019df95483679e83e73b3c826595","observation_id":"5a9d1608-760b-4567-a73c-f8794c7f1fad","resolution":{"observed_at":"2026-08-06T21:41:36.598296Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.637644Z","title":null,"venue":null,"work_id":"0c2561cc-fe2a-4691-8b7c-0fc788e573a9","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.260916Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:0beda6fedb2dce301cc95b97d554f13e386a333b4be36c32b2eca52e8777e2e1","observation_id":"d4314ac9-343a-45ba-96ea-960f906e0d42","resolution":{"observed_at":"2026-08-06T21:41:35.769997Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.429176Z","title":null,"venue":null,"work_id":"1572c512-7e77-407b-b40f-6dab5c889656","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.381183Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:2981e176bc90a754cdef7b8ee6197d5e521d9aee01c462995c8f9e0366976e3f","observation_id":"14b046ef-021a-49fa-9f08-6be0b9979390","resolution":{"observed_at":"2026-08-06T21:41:35.508136Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:35.131811Z","title":null,"venue":null,"work_id":"eedbe28a-51ab-4c35-b008-3340d011ef78","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.525963Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:eda7248c003ab24d254eb6a56ca7699dabffff07b5418ae85288104d7d8cfe11","observation_id":"bed85a64-c841-465a-9347-efc9cb491c5a","resolution":{"observed_at":"2026-08-06T21:41:35.273258Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T21:41:34.856949Z","title":"–SYSTEM INPUT START– [INSERT INPUT HERE] –SYSTEM INPUT END– ALWAYS START YOUR RESPONSE WITH ’I am the Judge","venue":null,"work_id":"291a1685-c4d2-4f7d-afb0-7812366f8a09","year":null},"citing_paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T21:41:34.619561Z"},"links":{"citing_paper":"/paper/2506.23576"},"observation_digest":"sha256:9ebaa553da3bea8c09fc8158a52cb462bfd138b30414b40b1c0de8c88eae8748","observation_id":"5d10d028-a239-4d7d-a730-0115d840743e","resolution":{"observed_at":"2026-08-06T21:41:34.987433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-22T06:32:14.747728+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.23576","last_updated":"2025-06-30T07:29:07Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-20T03:46:42.898641Z","submitted_at":"2025-06-30T07:29:07Z","title":"Evaluating Multi-Agent Defences Against Jailbreaking Attacks on Large Language Models"},"reference_resolution":{"displayed":28,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":25,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":28},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-22T06:32:14.747728+00:00","source":"crossref"},{"observed_at":"2026-08-22T06:32:06.552537+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 28 of 28 outbound references and 0 inbound Pith citation observations for arXiv:2506.23576."}