DeltaRubric decomposes multimodal preference evaluation into self-generated planning and verification steps within a single model, producing large accuracy improvements on VL-RewardBench via multi-role reinforcement learning.
Benchmarking large multimodal models against common corruptions
2 Pith papers cite this work. Polarity classification is still indexing.
2
Pith papers citing it
citation-role summary
background 1
citation-polarity summary
years
2026 2verdicts
UNVERDICTED 2roles
background 1polarities
background 1representative citing papers
Robust-TO integrates per-frame reliability scores into tool orchestration and a confidence-cost GRPO reward to improve video reasoning robustness under corruption.
citing papers explorer
-
DeltaRubric: Generative Multimodal Reward Modeling via Joint Planning and Verification
DeltaRubric decomposes multimodal preference evaluation into self-generated planning and verification steps within a single model, producing large accuracy improvements on VL-RewardBench via multi-role reinforcement learning.
-
Confidence-Aware Tool Orchestration for Robust Video Understanding
Robust-TO integrates per-frame reliability scores into tool orchestration and a confidence-cost GRPO reward to improve video reasoning robustness under corruption.