Researchers introduce ARC (Advantage Regularization via Conditioning), a training methodology addressing fairness issues when comparing diverse interaction behaviors in reinforcement learning, using strategy-conditioned rollout grouping together with hybrid rewards and entropy regularization to ensure equitable advantage comparisons across different agent communication styles. The work presents an interaction paradigm that decouples visible communication from internal reasoning, supported by an 86,000-item annotated training corpus. Evaluation shows substantial improvements on tool-use benchmarks while cutting response latency from 4.91 to 1.27 seconds compared to baselines.
