Pith. sign in

← back to paper

Review history

arxiv: 2608.02786 · 2 revisions

Evaluation Blindness: How Silent Measurement Failures Corrupt AI Systems from Training to Deployment

  1. 2026-08-15 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 5.0
    117139 ms 17972 in 12941 out 2026-08-15T14:59:32.911840+00:00
  2. 2026-08-07 CONDITIONAL MODERATE v1.4.0-alltime-deepseek-medium novelty 6.0
    443306 ms 17978 in 13797 out 2026-08-07T00:07:49.542487+00:00