{"as_of":"2026-08-17T15:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:da6ea9b1413591e4f069a93057c56cc5eb81070e3cc0aca7eb221775fc2b8b41","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T22:24:23.461464Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2508.07139/citation-record","integrity":"/paper/2508.07139/integrity","json":"/paper/2508.07139/citation-record.json","paper":"/paper/2508.07139"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.179314Z","title":"Figure is the first-of-its-kind ai robotics company bringing a general purpose humanoid to life","venue":null,"work_id":"4fbb230e-3d14-4785-8437-e10e3223d74e","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.338114Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:149e7d3590108f457db161ce1c8948eafe8ca05a51cfdd07765d9378afb01be8","observation_id":"7391a8be-7c97-42c9-bb97-0298bf8a5c69","resolution":{"observed_at":"2026-08-05T22:24:24.182075Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.04306","last_updated":"2025-01-08T06:44:02Z","snapshot_observed_at":"2026-08-13T09:15:34.978879Z","submitted_at":"2025-01-08T06:44:02Z","title":"LLM4SR: A Survey on Large Language Models for Scientific Research","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.04306","snapshot_observed_at":"2026-08-05T22:24:23.341478Z","title":"Llm4sr: A survey on large language models for scientific research","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.341478Z"},"links":{"cited_paper":"/paper/2501.04306","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:94574ef43ed1021dd6817dc46702f1acdff411758fe400d0169a4ab5bfd7d33c","observation_id":"5d1f4862-45a8-48fe-a310-10ff7bc6b967","resolution":{"observed_at":"2026-08-05T22:24:23.341478Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.09224","last_updated":"2024-11-14T06:40:55Z","snapshot_observed_at":"2026-08-13T20:43:37.146274Z","submitted_at":"2024-11-14T06:40:55Z","title":"Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers","version":1},"cited_work":{"arxiv_id":"2411.09224","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.09224","snapshot_observed_at":"2026-08-05T22:24:24.099457Z","title":"Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers","venue":"cs.SE","work_id":"94801aa6-b9af-4638-9e07-eec205dce3c2","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.344893Z"},"links":{"cited_paper":"/paper/2411.09224","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:b9f9ec0c53038d87ada7c403b7596ae4b53c350d108d47e6d53d13aa175da6fa","observation_id":"6b90a4a2-f2f7-499b-a985-a59f4be0b0a1","resolution":{"observed_at":"2026-08-05T22:24:24.102705Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.170329Z","title":"Transparency & con- tent moderation","venue":null,"work_id":"56f91213-2057-4ba1-a1a5-46b0170cc66b","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.348342Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:fe5536152adc6337452efb726e70f6ad494700316e69dde840ae21313e2de676","observation_id":"5638842d-1e1e-4241-8613-6e8323b004b9","resolution":{"observed_at":"2026-08-05T22:24:24.173535Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17704","last_updated":"2025-05-24T12:50:56Z","snapshot_observed_at":"2026-08-17T04:56:11.949246Z","submitted_at":"2025-04-24T16:11:01Z","title":"Safety in Large Reasoning Models: A Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.17704","snapshot_observed_at":"2026-08-05T22:24:23.351363Z","title":"Safety in large reasoning models: A survey","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.351363Z"},"links":{"cited_paper":"/paper/2504.17704","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:e6f2975444d4606d100eea31797de746ecb017fe47ae6966b14af1c981e5dd9c","observation_id":"e7308aa5-db82-4b9c-8e55-a541a0873104","resolution":{"observed_at":"2026-08-05T22:24:23.351363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12617","last_updated":"2024-10-23T06:28:19Z","snapshot_observed_at":"2026-08-16T14:17:07.926474Z","submitted_at":"2024-02-20T00:51:05Z","title":"Generative AI Security: Challenges and Countermeasures","version":2},"cited_work":{"arxiv_id":"2402.12617","doi":null,"metadata_source":"pith","pith_arxiv_id":"2402.12617","snapshot_observed_at":"2026-08-05T22:24:24.078464Z","title":"Generative AI Security: Challenges and Countermeasures","venue":"cs.CR","work_id":"53b88735-880f-4b3f-a707-6981963abef0","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.354632Z"},"links":{"cited_paper":"/paper/2402.12617","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:559f9b4658c80f6622f57a8288906111373d16a027e43fcf4af2e0053431ba8b","observation_id":"d9ced9b5-dfba-486c-9578-eca36764c4f8","resolution":{"observed_at":"2026-08-05T22:24:24.081871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00898","last_updated":"2024-01-31T19:52:00Z","snapshot_observed_at":"2026-08-16T14:22:44.256192Z","submitted_at":"2024-01-31T19:52:00Z","title":"An Early Categorization of Prompt Injection Attacks on Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00898","snapshot_observed_at":"2026-08-05T22:24:23.358065Z","title":"An early categorization of prompt injection attacks on large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.358065Z"},"links":{"cited_paper":"/paper/2402.00898","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:c8f7b287a468ac44701ab344db2fd12368c987cd2cf67c6447e42b9c9e945d59","observation_id":"8e786645-fec1-4eaa-b3f5-521d89246074","resolution":{"observed_at":"2026-08-05T22:24:23.358065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.13457","last_updated":"2024-05-17T05:00:24Z","snapshot_observed_at":"2026-08-16T14:16:46.139055Z","submitted_at":"2024-02-21T01:26:39Z","title":"A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.13457","snapshot_observed_at":"2026-08-05T22:24:23.361494Z","title":"A comprehensive study of jail- break attack versus defense for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.361494Z"},"links":{"cited_paper":"/paper/2402.13457","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:4502c88c92212d82f21bdb5707c4a661db91603d9c770a3daae3757b685933d3","observation_id":"25f5f323-7136-4f16-b93b-e827df8a1a61","resolution":{"observed_at":"2026-08-05T22:24:23.361494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08419","last_updated":"2024-07-18T18:24:57Z","snapshot_observed_at":"2026-08-16T13:08:51.920120Z","submitted_at":"2023-10-12T15:38:28Z","title":"Jailbreaking Black Box Large Language Models in Twenty Queries","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08419","snapshot_observed_at":"2026-08-05T22:24:23.364780Z","title":"Pappas, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.364780Z"},"links":{"cited_paper":"/paper/2310.08419","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:ba3abe3a3d2507855f99c5091073c3ab3aebdccaf8b10e6e25b7271349ab46a3","observation_id":"aeb3f901-57ff-4af9-acb5-5111c7461fc8","resolution":{"observed_at":"2026-08-05T22:24:23.364780Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T22:24:23.367757Z","title":"Zico Kolter, and Matt Fredrik- son","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.367757Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:c140af86144c3a9482a819ddcd2a78bb21288deb642272c184361890118edb8e","observation_id":"f9154070-1a34-4e73-923e-6ee24ea89336","resolution":{"observed_at":"2026-08-05T22:24:23.367757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-05T22:24:23.370952Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.370952Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:fcba409028138e97436a473e6f773f4b921e967b26a69a5bf5d50248226809dd","observation_id":"7d61f6a0-21f0-49ac-8c78-8c4f567ec487","resolution":{"observed_at":"2026-08-05T22:24:23.370952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.03876","last_updated":"2024-12-21T11:24:01Z","snapshot_observed_at":"2026-08-16T13:37:04.630236Z","submitted_at":"2024-07-04T12:14:27Z","title":"Automated Progressive Red Teaming","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.03876","snapshot_observed_at":"2026-08-05T22:24:23.374081Z","title":"Auto- mated progressive red teaming","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.374081Z"},"links":{"cited_paper":"/paper/2407.03876","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:61f2861592e71946d2cd2f816974300013eb12ff679e79d0d741ef4e36e9ddd0","observation_id":"36f81cd8-a2af-4bc7-9036-38570bad6593","resolution":{"observed_at":"2026-08-05T22:24:23.374081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06674","last_updated":"2023-12-07T19:40:50Z","snapshot_observed_at":"2026-08-14T15:42:19.849118Z","submitted_at":"2023-12-07T19:40:50Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06674","snapshot_observed_at":"2026-08-05T22:24:23.377564Z","title":"Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.377564Z"},"links":{"cited_paper":"/paper/2312.06674","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:10c20ebcf2b32af6a8c5a35737694d347da678a4493c223112d8b4809e4063cb","observation_id":"f5881f87-bd05-4c12-9048-d554c8f0467d","resolution":{"observed_at":"2026-08-05T22:24:23.377564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.380458Z","title":"Guardreasoner: Towards reasoning-based llm safeguards","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.380458Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:c8e0e85e5fc223302c5c970218754b457f7bededa8040accb3050c13f3dcb909","observation_id":"4091594c-9b3b-432b-a662-ee436b4b52d9","resolution":{"observed_at":"2026-08-05T22:24:23.380458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18837","last_updated":"2025-01-31T01:09:32Z","snapshot_observed_at":"2026-08-08T23:58:18.293467Z","submitted_at":"2025-01-31T01:09:32Z","title":"Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18837","snapshot_observed_at":"2026-08-05T22:24:23.383158Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.383158Z"},"links":{"cited_paper":"/paper/2501.18837","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:69eab4666cd232002aa41243047fb55c156eef3fb02f7527a119e8313dc509ef","observation_id":"27b1f05c-b712-400d-9fbf-e9f05964dca7","resolution":{"observed_at":"2026-08-05T22:24:23.383158Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.14132","last_updated":"2023-11-07T03:30:15Z","snapshot_observed_at":"2026-08-15T21:55:47.604051Z","submitted_at":"2023-08-27T15:20:06Z","title":"Detecting Language Model Attacks with Perplexity","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.14132","snapshot_observed_at":"2026-08-05T22:24:23.386156Z","title":"Detecting language model attacks with perplexity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.386156Z"},"links":{"cited_paper":"/paper/2308.14132","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8ea8e86e1bdc600b37db65999949bd49b3603c1e4efa8258b5fdc1213a921a51","observation_id":"a14cefd3-7265-4657-a8ff-e57cf764095e","resolution":{"observed_at":"2026-08-05T22:24:23.386156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.17263","last_updated":"2024-11-08T06:57:05Z","snapshot_observed_at":"2026-08-16T14:23:07.803905Z","submitted_at":"2024-01-30T18:56:08Z","title":"Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.17263","snapshot_observed_at":"2026-08-05T22:24:23.388868Z","title":"Ro- bust prompt optimization for defending lan- guage models against jailbreaking attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.388868Z"},"links":{"cited_paper":"/paper/2401.17263","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8d7bd065de70888b6ba39f09a35d22349eb6b617ce3a76073beea3126ddca8e7","observation_id":"cadf9baa-dbf5-470b-94e7-9452b8d9df02","resolution":{"observed_at":"2026-08-05T22:24:23.388868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.391656Z","title":"Darkmind: Latent chain-of-thought backdoor in customized llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.391656Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:091856a3d0200d8ffcd3fdc39e7294e9c87de8582b80e9aa6254c476471f59df","observation_id":"eae6fbe7-eee7-4c94-98b8-9d683797b3b1","resolution":{"observed_at":"2026-08-05T22:24:23.391656Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02832","last_updated":"2026-05-15T07:55:39Z","snapshot_observed_at":"2026-08-16T23:15:47.586831Z","submitted_at":"2024-10-02T08:41:23Z","title":"FlipAttack: Jailbreak LLMs via Flipping","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02832","snapshot_observed_at":"2026-08-05T22:24:23.394303Z","title":"Flipattack: Jailbreak llms via flipping","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.394303Z"},"links":{"cited_paper":"/paper/2410.02832","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:fd404966998446f314bfa6256a229496f7ac880d33305561d7a7e3ce8c5a6c8d","observation_id":"65c8ba88-8154-4c93-9a36-c3bc90625b88","resolution":{"observed_at":"2026-08-05T22:24:23.394303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11272","last_updated":"2024-10-15T04:53:34Z","snapshot_observed_at":"2026-08-16T13:09:19.954854Z","submitted_at":"2024-10-15T04:53:34Z","title":"Cognitive Overload Attack:Prompt Injection for Long Context","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.11272","snapshot_observed_at":"2026-08-05T22:24:23.397460Z","title":"Cognitive overload attack: Prompt injection for long context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.397460Z"},"links":{"cited_paper":"/paper/2410.11272","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:374455efa0727fde7bfb36f0116022b29ca1e448b3983addc698328e1c034bb2","observation_id":"a0fce363-85d8-440d-a75a-6b4fbf955769","resolution":{"observed_at":"2026-08-05T22:24:23.397460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09096","last_updated":"2024-06-12T08:28:15Z","snapshot_observed_at":"2026-08-16T14:43:01.387615Z","submitted_at":"2023-11-15T16:42:29Z","title":"Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09096","snapshot_observed_at":"2026-08-05T22:24:23.400378Z","title":"Defending large language models against jailbreaking at- tacks through goal prioritization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.400378Z"},"links":{"cited_paper":"/paper/2311.09096","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:f6d7e5fbea350399291599f5add4f62905e97827333356ebe6b932ee7a2f2198","observation_id":"c9d93443-48d4-44b2-a70e-26cad4fef8f2","resolution":{"observed_at":"2026-08-05T22:24:23.400378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02705","last_updated":"2025-02-04T19:47:09Z","snapshot_observed_at":"2026-08-16T15:02:58.647281Z","submitted_at":"2023-09-06T04:37:20Z","title":"Certifying LLM Safety against Adversarial Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02705","snapshot_observed_at":"2026-08-05T22:24:23.403420Z","title":"Certifying llm safety against adversarial prompting","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.403420Z"},"links":{"cited_paper":"/paper/2309.02705","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:0d83601b7ea021dc7d25b97d39c54efdcaeddafa64dfe87ead96963f5c926526","observation_id":"c02eec3d-2f04-4f2e-9a7c-0af33298520a","resolution":{"observed_at":"2026-08-05T22:24:23.403420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.06363","last_updated":"2024-09-25T19:48:39Z","snapshot_observed_at":"2026-08-16T14:19:54.814069Z","submitted_at":"2024-02-09T12:15:51Z","title":"StruQ: Defending Against Prompt Injection with Structured Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.06363","snapshot_observed_at":"2026-08-05T22:24:23.406310Z","title":"Struq: Defending against prompt injection with structured queries","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.406310Z"},"links":{"cited_paper":"/paper/2402.06363","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:f763fe0b372be92deb77ccf6095bd0ff9514c44a1a91248eddac5de4e1a46c7f","observation_id":"c18ad7e4-5ccd-4f0c-9ba0-097ab8d99443","resolution":{"observed_at":"2026-08-05T22:24:23.406310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20769","last_updated":"2025-04-29T13:50:05Z","snapshot_observed_at":"2026-08-16T05:18:00.727452Z","submitted_at":"2025-04-29T13:50:05Z","title":"Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20769","snapshot_observed_at":"2026-08-05T22:24:23.409209Z","title":"Chain-of-defensive-thought: Structured reason- ing elicits robustness in large language mod- els against reference corruption","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.409209Z"},"links":{"cited_paper":"/paper/2504.20769","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:3a2cb89a1aee36164f4258c58a1ca00994ec807ef05536367077ad0da1b944ce","observation_id":"6a85e04b-2048-4be5-8a44-fb8cd3b497a4","resolution":{"observed_at":"2026-08-05T22:24:23.409209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00029","last_updated":"2024-08-18T22:26:13Z","snapshot_observed_at":"2026-08-16T14:42:47.841549Z","submitted_at":"2023-11-16T07:31:18Z","title":"Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00029","snapshot_observed_at":"2026-08-05T22:24:23.412222Z","title":"Bergeron: Combat- ing adversarial attacks through a conscience- based alignment framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.412222Z"},"links":{"cited_paper":"/paper/2312.00029","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:a275ae8963e811255dd5601360e339231f960bb0576de939f4e92950cedbba38","observation_id":"5914d115-67d8-40fc-9bc3-059d850101bb","resolution":{"observed_at":"2026-08-05T22:24:23.412222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12702","last_updated":"2024-06-21T00:05:35Z","snapshot_observed_at":"2026-08-16T13:41:47.293271Z","submitted_at":"2024-06-18T15:14:35Z","title":"[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs","version":2},"cited_work":{"arxiv_id":"2406.12702","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12702","snapshot_observed_at":"2026-08-05T22:24:23.769248Z","title":"[WIP] Jailbreak Paradox: The Achilles' Heel of LLMs","venue":"cs.CL","work_id":"29e48471-a978-4493-a3cf-f91dd8c997da","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.415082Z"},"links":{"cited_paper":"/paper/2406.12702","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:b3f97615cc676ed38c7d955d0fc5a4f823797b5c5cd5d06a75838e1566953f5a","observation_id":"0b083229-859f-45e9-ba9a-04ba2282bedb","resolution":{"observed_at":"2026-08-05T22:24:23.773604Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.417921Z","title":"Inverse scaling in test-time compute","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.417921Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:bda67b340670d3511382e02d63c25aa01d60434b70baa980952c2f96e6e35944","observation_id":"bc9fc4d6-c4ad-4bc0-9fea-29acd3183568","resolution":{"observed_at":"2026-08-05T22:24:23.417921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04451","last_updated":"2024-03-20T21:34:56Z","snapshot_observed_at":"2026-08-16T14:36:14.029419Z","submitted_at":"2023-10-03T19:44:37Z","title":"AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04451","snapshot_observed_at":"2026-08-05T22:24:23.420770Z","title":"Autodan: Generating stealthy jailbreak prompts on aligned large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.420770Z"},"links":{"cited_paper":"/paper/2310.04451","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:99a88309c544510954a426523eee220f8334fc3d450971d5cb827d07a4459c95","observation_id":"292270f7-49e3-409b-9f56-b2d029405619","resolution":{"observed_at":"2026-08-05T22:24:23.420770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02119","last_updated":"2024-10-31T15:57:42Z","snapshot_observed_at":"2026-08-16T14:37:45.469470Z","submitted_at":"2023-12-04T18:49:23Z","title":"Tree of Attacks: Jailbreaking Black-Box LLMs Automatically","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02119","snapshot_observed_at":"2026-08-05T22:24:23.423635Z","title":"Tree of attacks: Jail- breaking black-box llms automatically","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.423635Z"},"links":{"cited_paper":"/paper/2312.02119","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:fc2ba6ed9cb8f59872e30ce24cd2e4d62012ff3e0e6e3c31dc1e80d7d4448e2a","observation_id":"0a29a3b9-574a-4820-b283-be94d39e5285","resolution":{"observed_at":"2026-08-05T22:24:23.423635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.14368","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.665510Z","title":"Is your prompt safe? inves- tigating prompt injection attacks against open- source llms","venue":null,"work_id":"6d4cc548-fb08-464a-912b-80a68cde29da","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.426274Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:5a963216377c16954870ea21c0731c36ccf50b8f2a466b2791443c3e6131ccd6","observation_id":"a0d877c6-550c-49dc-ad53-43e90eb75a82","resolution":{"observed_at":"2026-08-05T22:24:23.671877Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06387","last_updated":"2024-05-25T07:01:15Z","snapshot_observed_at":"2026-08-16T14:53:33.115609Z","submitted_at":"2023-10-10T07:50:29Z","title":"Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06387","snapshot_observed_at":"2026-08-05T22:24:23.428703Z","title":"Jailbreak and guard aligned lan- guage models with only few in-context demon- strations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.428703Z"},"links":{"cited_paper":"/paper/2310.06387","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:f67239eb0c5f3f46b33461d48b2f0a02e89e74c5ba6aec91cfe355c9d5954b12","observation_id":"11d2042c-6acd-4c2f-8ba3-21a2845c9a02","resolution":{"observed_at":"2026-08-05T22:24:23.428703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.161629Z","title":"Novel uni- versal bypass for all major llms: The pol- icy puppetry prompt injection technique","venue":null,"work_id":"951022a7-e3f0-4b3b-ae46-11f921346417","year":null},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.431436Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:7ef6386e2cfe762943e709a4bd1f58a6de40585934670b019d9b6c6beab7db3f","observation_id":"169c30b9-ac90-405b-ad14-488529ed8d30","resolution":{"observed_at":"2026-08-05T22:24:24.164461Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:23.437009Z","title":"Gasp: Ef- ficient black-box generation of adversarial suf- fixes for jailbreaking llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.437009Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:be0cf0e9f12bfcabfb03fd99e025d168c4de5cbe4bbccfbbd2b3e966cf0832e3","observation_id":"bc7c92e6-da17-4e6a-bb46-6f84710aca3a","resolution":{"observed_at":"2026-08-05T22:24:23.437009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.144237Z","title":"Jailbreakchat","venue":null,"work_id":"cc4cdb57-c9c3-456d-95dc-adaac51a9932","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.439933Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:1fcc259a3ff8534a1733637312c38356ba6bc8375eef7c2631bdf086ed27016b","observation_id":"175940b2-da68-45f0-a1c1-2ea318351b51","resolution":{"observed_at":"2026-08-05T22:24:24.147077Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.135349Z","title":"Gemini loki gem (no limits)","venue":null,"work_id":"5a96cb40-7231-4ecd-bb1e-434d4ed0f715","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.442501Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:2046f7d987e607eba347bdeb29dd2c40a76b402914bff31842e56590bdde3bdd","observation_id":"a2d3994d-878a-40a9-9533-c321ca8cf22f","resolution":{"observed_at":"2026-08-05T22:24:24.138665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.126537Z","title":"Jailbreaks","venue":null,"work_id":"d9cc9ef5-5cae-4328-bb12-62711a896988","year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.445028Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:5598f70f4e6cd4ff57282dc3422dc5a9fd073ccec61f78c50baff3c9b9fdd655","observation_id":"3afbdf64-a2d6-4552-8966-43ceb54b7426","resolution":{"observed_at":"2026-08-05T22:24:24.129526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05498","last_updated":"2025-02-05T10:29:07Z","snapshot_observed_at":"2026-08-16T16:13:49.286404Z","submitted_at":"2024-06-08T15:45:31Z","title":"SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05498","snapshot_observed_at":"2026-08-05T22:24:23.447796Z","title":"Selfdefend: Llms can defend themselves against jailbreaking in a practical manner","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.447796Z"},"links":{"cited_paper":"/paper/2406.05498","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:721a8be03fc05bf913b2fa6c646fefc362787e98ef8f303ed62a6573144d2f83","observation_id":"a0f85fb0-18e7-4f1b-9981-7406b00454ee","resolution":{"observed_at":"2026-08-05T22:24:23.447796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04783","last_updated":"2024-11-14T18:14:00Z","snapshot_observed_at":"2026-08-16T14:13:28.210442Z","submitted_at":"2024-03-02T16:52:22Z","title":"AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04783","snapshot_observed_at":"2026-08-05T22:24:23.450421Z","title":"Autodefense: Multi- agent llm defense against jailbreak attacks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.450421Z"},"links":{"cited_paper":"/paper/2403.04783","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:de92ac512800c95532b2bfdfbb8970c751060abd15e2d44efc785b5b94aa7cc1","observation_id":"f41039d3-9d9d-411b-99f0-e8eda572e6bf","resolution":{"observed_at":"2026-08-05T22:24:23.450421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20965","last_updated":"2025-06-13T22:43:06Z","snapshot_observed_at":"2026-08-16T05:12:42.263643Z","submitted_at":"2025-04-29T17:36:05Z","title":"AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.20965","snapshot_observed_at":"2026-08-05T22:24:23.453331Z","title":"Bartoldson, Bhavya Kailkhura, Tom Goldstein, and Furong Huang","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.453331Z"},"links":{"cited_paper":"/paper/2504.20965","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:abd22c13007434f3998e4e43226d982d226b536a100fcda49573eac23f698afe","observation_id":"e78c59b7-4194-4955-bbbb-d5b4e002dda8","resolution":{"observed_at":"2026-08-05T22:24:23.453331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01318","last_updated":"2024-10-31T22:26:40Z","snapshot_observed_at":"2026-08-11T16:28:21.917686Z","submitted_at":"2024-03-28T02:44:02Z","title":"JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01318","snapshot_observed_at":"2026-08-05T22:24:23.455996Z","title":"Pappas, Florian Tramer, Hamed Hassani, and Eric Wong","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.455996Z"},"links":{"cited_paper":"/paper/2404.01318","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:2ffecc93defc4703816d48f2da071a3a9c500af35718772a9cd3be112101471a","observation_id":"33142d37-3f13-4dd2-a5dd-8f29cc5f9291","resolution":{"observed_at":"2026-08-05T22:24:23.455996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.00598","last_updated":"2025-06-11T03:14:28Z","snapshot_observed_at":"2026-08-17T04:34:36.439951Z","submitted_at":"2024-09-01T03:25:59Z","title":"Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.00598","snapshot_observed_at":"2026-08-05T22:24:23.458700Z","title":"Automatic pseudo-harmful prompt generation for evaluating false refusals in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.458700Z"},"links":{"cited_paper":"/paper/2409.00598","citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:8016d8a87a75b32726b8919dcd50da1a8dc0be38ddb482cb313bdfea6d9f2f10","observation_id":"7acea42f-75e7-47b0-adfb-176c818a5870","resolution":{"observed_at":"2026-08-05T22:24:23.458700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.117752Z","title":"Prompt injections bench- mark","venue":null,"work_id":"eac975fc-8c04-4ef0-8c03-9d73606e06a1","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.461464Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:c0b3430de9a51d948937f91128929b58bbd52068e8a9912d9453ed92a222ff16","observation_id":"38cfd376-935a-4299-bfdd-150911536cc0","resolution":{"observed_at":"2026-08-05T22:24:24.120690Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T22:24:24.152803Z","title":null,"venue":null,"work_id":"399081cc-20da-4b06-966a-0dc893aa7310","year":2025},"citing_paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-05T22:24:23.434501Z"},"links":{"citing_paper":"/paper/2508.07139"},"observation_digest":"sha256:9cfd50bb07b425e5fdf18a02803541b76e0b4d8ac4825ec0e08a3bdc71c12aee","observation_id":"5768ea9b-0038-4677-b9f1-61873ad621bf","resolution":{"observed_at":"2026-08-05T22:24:24.155549Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.07139","last_updated":"2025-08-10T01:59:07Z","latest_version":1,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-10T21:58:51.152330Z","submitted_at":"2025-08-10T01:59:07Z","title":"A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":31,"verified_exact":4,"verified_fuzzy":7},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2508.07139."}