CoVA-SFT is a structured corpus of 51,900 samples containing over 222,000 multimodal reasoning steps, designed to train multimodal language models on chain-of-visual-abstraction reasoning that interleaves textual and visual reasoning through explicit rationales, renderings, and verification loops. The accompanying CoVA-Bench provides 1,700 test samples, addressing a gap in training resources for multimodal chain-of-thought reasoning.
