Skip to yearly menu bar Skip to main content


Selective Cross-Modal Alignment in Vision-Language Models: Why Position Grounding Succeeds but Physical Reasoning Fails

Muzapar Muhtar

Abstract

Chat is not available.