Pith. sign in

← back to paper

Review history

arxiv: 2607.01153 · 3 revisions

Adversarial Pragmatics for AI Safety Evaluation: A Diagnostic Framework and Seed Benchmark for Language-Mediated Control

  1. 2026-08-15 ACCEPT HIGH v1.4.0-alltime-deepseek-medium novelty 6.0
    122248 ms 33660 in 14889 out 2026-08-15T15:35:38.891395+00:00
  2. 2026-08-02 CONDITIONAL MODERATE v1.3.0-alltime-deepseek novelty 6.0
    245252 ms 69 in 12497 out 2026-08-02T09:07:51.234749+00:00
  3. 2026-07-02 UNVERDICTED LOW v0.9.1-grok novelty 5.0
    26341 ms 5727 in 1027 out 2026-07-02T12:28:35.335206+00:00