{"id":"1704e2dd-65d2-4789-86de-86dc5c8a1a2e","arxiv_id":"2504.12016","paper_version":2,"verdict":"REJECT","confidence":"HIGH","novelty_score":5.0,"correctness_risk":"high","formal_verification":"none","parameter_count":2,"one_line_summary":"Neural-ADB claims an O~((d/T)^(1/2)) worst sub-optimality gap for active contextual dueling bandits with non-linear rewards, but the proof relies on a reversed matrix inequality.","lead":"Neural-ADB is an algorithm for choosing which pairs of items to show humans for preference feedback while learning a non-linear reward function. It promises fewer required comparisons for tasks like LLM alignment, but the main proof contains a mathematical error.","discovery_kind":"extension","skeptic_critique":null,"referee_report":null,"author_rebuttal":null,"desk_editor":null,"rs_alignment":null,"lean_confirmation":null,"pith_extraction":null,"created_at":"2026-08-16T12:41:24.132568+00:00","model_set":{"reader":"deepseek-v4-flash"},"falsifier":null,"supporting_citations":[],"review_version":1}