Trustworthy and Safe Reasoning in End-to-End Autonomous Driving Foundation Models
Abstract
End-to-end (E2E) foundation models are increasingly being adopted in autonomous driving, directly mapping sensory observations to trajectories or control actions. Modern state-of-the-art vision-language-action (VLA) models extend this paradigm by generating textual chain-of-thought (CoT) reasoning before action prediction. While CoT can improve driving performance, it also introduces a new failure mode: incorrect or hallucinated reasoning can propagate into unsafe actions. We introduce Token-level Reward for Utility-Steered Trajectories (TRUST), an offline-trained method for monitoring and steering CoT reasoning in VLA models. On Alpamayo-1.5, TRUST achieves 87.7\% monitoring accuracy and improves reasoning correctness from 75.0\% to 89.9\% through steering. In closed-loop evaluation, TRUST reduces trajectory error by up to 8.3\% while directionally improving most safety metrics. These results show that steering CoT reasoning can improve the closed-loop behavior of reasoning-enabled autonomous-driving foundation models.