This paper introduces personalized ambiguity adaptation as a new evaluation task for AI coding assistants: given a user’s prior resolved coding sessions, an assistant should infer that user’s recurring ambiguity patterns and produce correct code with less clarification needed. The authors build CAPA, a benchmark of 600 coding sessions spanning 60 user-ambiguity combinations (300 held out for evaluation), covering six distinct mechanisms of personalized ambiguity. Testing 12 recent LLMs under both no-history and same-user-history conditions, they measure executable success, first-turn success, and turns-to-completion. Results establish a foundation for building coding assistants that adapt to individual users’ habitual phrasing across sessions.
