Pith. sign in

Paper Citation Record · LEDGER

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection

As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2508.07139.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.07139 v1

Coverage vector

measured 43 of 43 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-05T22:24:23.461464Z

measured 43 of 43 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-07T06:34:17.273281+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

43 of 43 outbound references displayed

  • verified exact4
  • verified fuzzy7
  • unresolved31
  • parse uncertain1
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 7391a8be-7c97-42c9-bb97-0298bf8a5c69 · outbound

This paper cites Figure is the first-of-its-kind ai robotics company bringing a general purpose humanoid to life.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Figure is the first-of-its-kind ai robotics company bringing a general purpose humanoid to life

Reference 1

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.182075Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.338114Z digest=sha256:5474debe2eee733533987ee02b3f83aea0a69d4faad0a69f340837b778ee5ccb

Observation 5d1f4862-45a8-48fe-a310-10ff7bc6b967 · outbound

This paper cites LLM4SR: A Survey on Large Language Models for Scientific Research.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection LLM4SR: A Survey on Large Language Models for Scientific Research

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.341478Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.341478Z digest=sha256:e4b90e855355705879174b94389f265817290bbd89ee85a9e8312077dd89b2bd

Observation 6b90a4a2-f2f7-499b-a985-a59f4be0b0a1 · outbound

This paper cites Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Programming with AI: Evaluating ChatGPT, Gemini, AlphaCode, and GitHub Copilot for Programmers

Reference 3

Resolution
verified exact
local_arxiv, observed 2026-08-05T22:24:24.102705Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.344893Z digest=sha256:e6b383e9a156c9b41645faafd78469499b672b1a6456857df647838447e07637

Observation 5638842d-1e1e-4241-8613-6e8323b004b9 · outbound

This paper cites Transparency & con- tent moderation.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Transparency & con- tent moderation

Reference 4

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.173535Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.348342Z digest=sha256:5517547276d107433a7895653aa0076a452fed2a38ecb83ce8910ad0f7d5c5da

Observation e7308aa5-db82-4b9c-8e55-a541a0873104 · outbound

This paper cites Safety in Large Reasoning Models: A Survey.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Safety in Large Reasoning Models: A Survey

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.351363Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.351363Z digest=sha256:91edce4032e02f9b0b1501bbbb3e262dd8d005d59507635a5da37bb548ded673

Observation d9ced9b5-dfba-486c-9578-eca36764c4f8 · outbound

This paper cites Generative AI Security: Challenges and Countermeasures.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Generative AI Security: Challenges and Countermeasures

Reference 6

Resolution
verified exact
local_arxiv, observed 2026-08-05T22:24:24.081871Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.354632Z digest=sha256:292925d8f6141dd2ace2fc6b0b75b85e52bbb42b051c5dc2b4fc895836785c80

Observation 8e786645-fec1-4eaa-b3f5-521d89246074 · outbound

This paper cites An Early Categorization of Prompt Injection Attacks on Large Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection An Early Categorization of Prompt Injection Attacks on Large Language Models

Reference 7

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.358065Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.358065Z digest=sha256:5cdf9501213c72ee5b5fd5eb8823b50929a78569af9c05c288870573c532709e

Observation 25f5f323-7136-4f16-b93b-e827df8a1a61 · outbound

This paper cites A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection A Comprehensive Study of Jailbreak Attack versus Defense for Large Language Models

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.361494Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.361494Z digest=sha256:7c57a091bc91f9745eff806a63163deb95194d920abc424edeacf01da26a4984

Observation aeb3f901-57ff-4af9-acb5-5111c7461fc8 · outbound

This paper cites Jailbreaking Black Box Large Language Models in Twenty Queries.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Jailbreaking Black Box Large Language Models in Twenty Queries

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.364780Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.364780Z digest=sha256:bba45dee926a904905cc778a6f1da6912eb0680dac3b816ba6e3a9d307ce644d

Observation f9154070-1a34-4e73-923e-6ee24ea89336 · outbound

This paper cites Universal and Transferable Adversarial Attacks on Aligned Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Universal and Transferable Adversarial Attacks on Aligned Language Models

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.367757Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.367757Z digest=sha256:0893127d01be1e5ec8d1cd65732eb43f53804e50ae478848b33c5d3064599d14

Observation 7d61f6a0-21f0-49ac-8c78-8c4f567ec487 · outbound

This paper cites Training language models to follow instructions with human feedback.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Training language models to follow instructions with human feedback

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.370952Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.370952Z digest=sha256:21edb21e7fb4c3c1d62d0d77c3762ebb44e8f4e9475d7f75387d2a0e7206744f

Observation 36f81cd8-a2af-4bc7-9036-38570bad6593 · outbound

This paper cites Automated Progressive Red Teaming.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Automated Progressive Red Teaming

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.374081Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.374081Z digest=sha256:71dc74c19af481beb8b79b1a40d84b1e6b349b6a4df155b242980da2efcc9591

Observation f5881f87-bd05-4c12-9048-d554c8f0467d · outbound

This paper cites Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Llama Guard: LLM-based Input-Output Safeguard for Human-AI Conversations

Reference 13

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.377564Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.377564Z digest=sha256:38b7f01f2425f2dbab82fec1048f28952f6c4073dbdefcb5e0fa7ac7b0750917

Observation 4091594c-9b3b-432b-a662-ee436b4b52d9 · outbound

This paper cites Guardreasoner: Towards reasoning-based llm safeguards.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Guardreasoner: Towards reasoning-based llm safeguards

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.380458Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.380458Z digest=sha256:dae5ab6e3e9fd5c0b9fa6c91875898ac9e119a19bdc9d520e621aa78c1915336

Observation 27b1f05c-b712-400d-9fbf-e9f05964dca7 · outbound

This paper cites Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Constitutional Classifiers: Defending against Universal Jailbreaks across Thousands of Hours of Red Teaming

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.383158Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.383158Z digest=sha256:7e62dd5a35f78b86c3f50cbdfdceba5857ae58c165fb5fbaec19d04da35ea861

Observation a14cefd3-7265-4657-a8ff-e57cf764095e · outbound

This paper cites Detecting Language Model Attacks with Perplexity.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Detecting Language Model Attacks with Perplexity

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.386156Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.386156Z digest=sha256:7e23fb89e79f9684fcbd4850e375d2ae15fef5f00c8ebdbfe64d62665a88fc72

Observation cadf9baa-dbf5-470b-94e7-9452b8d9df02 · outbound

This paper cites Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Robust Prompt Optimization for Defending Language Models Against Jailbreaking Attacks

Reference 17

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.388868Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.388868Z digest=sha256:15ef4d603354ea4fc12f4ff0d8ecb4ff2f98f0b63e7ae334799d8315fd652f7d

Observation eae6fbe7-eee7-4c94-98b8-9d683797b3b1 · outbound

This paper cites Darkmind: Latent chain-of-thought backdoor in customized llms.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Darkmind: Latent chain-of-thought backdoor in customized llms

Reference 18

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.391656Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.391656Z digest=sha256:8c7a1b6a2365e757c3163d646df89b51c356924df8736b13f990346808e29693

Observation 65c8ba88-8154-4c93-9a36-c3bc90625b88 · outbound

This paper cites FlipAttack: Jailbreak LLMs via Flipping.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection FlipAttack: Jailbreak LLMs via Flipping

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.394303Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.394303Z digest=sha256:3f88e3a1a2a9f3b77b5379f0334aad4536782a60df067fc813d3b133acd56610

Observation a0fce363-85d8-440d-a75a-6b4fbf955769 · outbound

This paper cites Cognitive Overload Attack:Prompt Injection for Long Context.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Cognitive Overload Attack:Prompt Injection for Long Context

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.397460Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.397460Z digest=sha256:3eefe532b8bf37b91ddf52317683c922033e3af0f3faa82a614d40b6028a61d9

Observation c9d93443-48d4-44b2-a70e-26cad4fef8f2 · outbound

This paper cites Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Defending Large Language Models Against Jailbreaking Attacks Through Goal Prioritization

Reference 21

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.400378Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.400378Z digest=sha256:d81d927ebbd2b55023e4bbd90ab07b7e34e0d5168f3777cc9950bca293e6d3cf

Observation c02eec3d-2f04-4f2e-9a7c-0af33298520a · outbound

This paper cites Certifying LLM Safety against Adversarial Prompting.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Certifying LLM Safety against Adversarial Prompting

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.403420Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.403420Z digest=sha256:0bb17fb54f78f518d079e96278c7718fb220cdaa307772a1f64aca19f3953d04

Observation c18ad7e4-5ccd-4f0c-9ba0-097ab8d99443 · outbound

This paper cites StruQ: Defending Against Prompt Injection with Structured Queries.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection StruQ: Defending Against Prompt Injection with Structured Queries

Reference 23

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.406310Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.406310Z digest=sha256:fabd4a74b9bd42c6e0dac3552698f08d46e56ff2d79c93d1eb4bedd7a0243e46

Observation 6a85e04b-2048-4be5-8a44-fb8cd3b497a4 · outbound

This paper cites Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Chain-of-Defensive-Thought: Structured Reasoning Elicits Robustness in Large Language Models against Reference Corruption

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.409209Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.409209Z digest=sha256:7c5839ba0f88425f1307cd8631e9e9c47ba704d3028ec7aa57b31798b92167f2

Observation 5914d115-67d8-40fc-9bc3-059d850101bb · outbound

This paper cites Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Bergeron: Combating Adversarial Attacks through a Conscience-Based Alignment Framework

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.412222Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.412222Z digest=sha256:56e81b27782d683204cd874c1c840570963d59583a7a580d121db766d348f5f3

Observation 0b083229-859f-45e9-ba9a-04ba2282bedb · outbound

This paper cites [WIP] Jailbreak Paradox: The Achilles' Heel of LLMs.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection [WIP] Jailbreak Paradox: The Achilles' Heel of LLMs

Reference 26

Resolution
verified exact
local_arxiv, observed 2026-08-05T22:24:23.773604Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.415082Z digest=sha256:f92d997728cded7dac641c20d9fa6eeacad52b9b693a5a2a225040f6c1b3e849

Observation bc9fc4d6-c4ad-4bc0-9fea-29acd3183568 · outbound

This paper cites Inverse scaling in test-time compute.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Inverse scaling in test-time compute

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.417921Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.417921Z digest=sha256:9d2692fc80546c71df28865c929180c14280ce4f2344dea5b64a38d8db6be68b

Observation 292270f7-49e3-409b-9f56-b2d029405619 · outbound

This paper cites AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection AutoDAN: Generating Stealthy Jailbreak Prompts on Aligned Large Language Models

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.420770Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.420770Z digest=sha256:a037faae5eefaf4eb02ad13ce6a1ff6ac81845f404c73516ab86ba48d157e785

Observation 0a29a3b9-574a-4820-b283-be94d39e5285 · outbound

This paper cites Tree of Attacks: Jailbreaking Black-Box LLMs Automatically.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Tree of Attacks: Jailbreaking Black-Box LLMs Automatically

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.423635Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.423635Z digest=sha256:9b65b00d30d4a7f47268dd2adf5dbacc2ed736a40d8745791b1b4385aa5d99e9

Observation a0d877c6-550c-49dc-ad53-43e90eb75a82 · outbound

This paper cites Is your prompt safe? inves- tigating prompt injection attacks against open- source llms.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Is your prompt safe? inves- tigating prompt injection attacks against open- source llms

Reference 30

Resolution
verified exact
raw_fallback, observed 2026-08-05T22:24:23.671877Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.426274Z digest=sha256:bd0e6738bbfabf469d2af1d668e4b2f62a3143ced9d756d8f30f4b65742ac6f9

Observation 11d2042c-6acd-4c2f-8ba3-21a2845c9a02 · outbound

This paper cites Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Jailbreak and Guard Aligned Language Models with Only Few In-Context Demonstrations

Reference 31

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.428703Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.428703Z digest=sha256:34696d23525fc351fe352f8282cccfc0fd753e40af462284d8b8034a9f0681e8

Observation 169c30b9-ac90-405b-ad14-488529ed8d30 · outbound

This paper cites Novel uni- versal bypass for all major llms: The pol- icy puppetry prompt injection technique.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Novel uni- versal bypass for all major llms: The pol- icy puppetry prompt injection technique

Reference 32

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.164461Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.431436Z digest=sha256:a209688e466f7e496ffdd96f08364b37248b4c8bb2ad694fa2acbdda9dd659f0

Observation bc7c92e6-da17-4e6a-bb46-6f84710aca3a · outbound

This paper cites Gasp: Ef- ficient black-box generation of adversarial suf- fixes for jailbreaking llms.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Gasp: Ef- ficient black-box generation of adversarial suf- fixes for jailbreaking llms

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.437009Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.437009Z digest=sha256:8a68b39a0fce076b1e8047c5a5da7123fee97a3e0d8315dba880d91b4ca5c5f7

Observation 175940b2-da68-45f0-a1c1-2ea318351b51 · outbound

This paper cites Jailbreakchat.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Jailbreakchat

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.147077Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.439933Z digest=sha256:29bce49e52d9eb70722e72852320efe9cdae441a7b0f90fe62cbdd6f9d93f51a

Observation a2d3994d-878a-40a9-9533-c321ca8cf22f · outbound

This paper cites Gemini loki gem (no limits).

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Gemini loki gem (no limits)

Reference 35

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.138665Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.442501Z digest=sha256:0eee1738698ae029519ea0ad4da1898129a99f7bca946a3a5b288a2d0493f379

Observation 3afbdf64-a2d6-4552-8966-43ceb54b7426 · outbound

This paper cites Jailbreaks.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Jailbreaks

Reference 36

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.129526Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.445028Z digest=sha256:338cbbbebb79ca70da49e4aa6b99d9d6ac193a42d751bc9121b28aeed8244a73

Observation a0f85fb0-18e7-4f1b-9981-7406b00454ee · outbound

This paper cites SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection SelfDefend: LLMs Can Defend Themselves against Jailbreaking in a Practical Manner

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.447796Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.447796Z digest=sha256:d35ba1175cd24fe974e1e2cacacd63a1ef8ac049d65111fb7a838f01d5782d13

Observation f41039d3-9d9d-411b-99f0-e8eda572e6bf · outbound

This paper cites AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection AutoDefense: Multi-Agent LLM Defense against Jailbreak Attacks

Reference 38

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.450421Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.450421Z digest=sha256:37228b7b4c4a18e80c91b7bf877aa562bb9c349c1d6e250cbdff2bae125428c6

Observation e78c59b7-4194-4955-bbbb-d5b4e002dda8 · outbound

This paper cites AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection AegisLLM: Scaling Agentic Systems for Self-Reflective Defense in LLM Security

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.453331Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.453331Z digest=sha256:1fe1089b980b063568415860e97fa75431cba9fbe6adfe727a0032a9fc8679ea

Observation 33142d37-3f13-4dd2-a5dd-8f29cc5f9291 · outbound

This paper cites JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection JailbreakBench: An Open Robustness Benchmark for Jailbreaking Large Language Models

Reference 40

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.455996Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.455996Z digest=sha256:0887c7430e9d4474e11164e08bcf38c184dc4e99b13e1cbd29cf0cb923bf2e93

Observation 7acea42f-75e7-47b0-adfb-176c818a5870 · outbound

This paper cites Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Automatic Pseudo-Harmful Prompt Generation for Evaluating False Refusals in Large Language Models

Reference 41

Resolution
unresolved
no resolver link, observed 2026-08-05T22:24:23.458700Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=pdf_text observed=2026-08-05T22:24:23.458700Z digest=sha256:8352dc602bb50b8c605164873b0e49c8d7d35ad453592ef896c6f5ad38ee1284

Observation 38cfd376-935a-4299-bfdd-150911536cc0 · outbound

This paper cites Prompt injections bench- mark.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Prompt injections bench- mark

Reference 42

Resolution
verified fuzzy
raw_fallback, observed 2026-08-05T22:24:24.120690Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.461464Z digest=sha256:35fda50afb79fde5aaa1bc9b123267136b1b933f8e01c53963bc89697def0cf6

Observation 5768ea9b-0038-4677-b9f1-61873ad621bf · outbound

This paper cites an unresolved cited work.

A Real-Time, Self-Tuning Moderator Framework for Adversarial Prompt Detection Unresolved cited work

Reference 2025

Resolution
parse uncertain
raw_fallback, observed 2026-08-05T22:24:24.155549Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.

source=pdf_text observed=2026-08-05T22:24:23.434501Z digest=sha256:46747bedd45784d524da315f0d627c545c313545ea9571e197845529ffbd51fb

Pith citing papers

No inbound Pith citation observations are available.