Researchers introduce OPDVR, a method integrating on-policy distillation with verifiable reward signals for language model training. The approach reformulates on-policy distillation’s implicit reward based on trajectory correctness and applies a ReLU gating mechanism to align distillation signals with task success while preserving teacher guidance. Testing across six reasoning benchmarks shows OPDVR consistently outperforms standard on-policy distillation without introducing additional hyperparameters.
