PotARCin: Multi-Dimensional Evaluation of Skill Acquisition in Abstract Reasoning Tasks
Abstract
The Abstraction and Reasoning Corpus (ARC) has become a prominent benchmark for evaluating skill acquisition in AI models. Yet standard ARC evaluation considers only a single capability: producing the correct output grid for a test input. We argue that this narrow format underestimates the diversity of abilities required for genuine abstract skill acquisition. We introduce PotARCin, a benchmark that extends ARC by assessing understanding of a task’s underlying abstract rule across five dimensions: Definition, Classification, Constrained Generation, Editing, and Inversion. PotARCin uses explicit generator and verifier programs, enabling dynamic generative sampling beyond fixed input-output pairs. Across four state-of-the-art models evaluated on the ARC-AGI-1 training set, we observe a 30–50 percentage-point performance gap between standard ARC evaluation and PotARCin. We further investigate effects of generative sampling, difficulty of corruption types and questions of self-consistency. We also introduce P-ARC, a hand-crafted test set with generator and verifier programs, on which models achieve 0-8% accuracy across all five dimensions, underscoring the difficulty of acquiring versatile abstract skills.