Commit Early, Refine Later? Probing Recursive Reasoning in TRM
Abstract
Recursive reasoning models generate intermediate latent states while solving a problem, but it remains unclear how solvability-relevant information develops across this computation. We study Tiny Recursive Models (TRMs) on ARC-AGI-1 and Sudoku Extreme by probing intermediate states for eventual solvability using predictive and coding-based measures. On ARC, the first outer-step latent strongly predicts eventual success (AUROC 0.895), with little progressive predictive or structural gain thereafter. On Sudoku, later recursion substantially reduces predictive uncertainty, while conditional epiplexity gain remains near zero, indicating little additional learnable solvability structure. Sequence-aware probes over latent trajectories provide no consistent advantage over single-state probes. Overall, our results are consistent with early commitment followed by later execution or refinement, rather than progressive structural discovery across recursion.