MSC-Mol: Modality-Synergy Contrasting for Multimodal Molecular Representation Learning
Abstract
Multimodal molecular representation learning plays a crucial role in drug discovery and molecular property prediction. Existing cross-modal alignment approaches primarily reinforce redundant information across modalities, often neglecting complementary synergistic signals critical for downstream tasks. To address this limitation, we propose MSC-Mol, a modality-synergy contrastive pre-training framework that encodes SMILES sequences, 2D molecular graphs, and 3D conformations into a unified fused representation, optimized via contrastive learning over augmented views. By introducing challenging negatives, including single-modality replacements and modality recombinations, MSC-Mol encourages the model to capture fine-grained cross-modal correspondences beyond dominant-modality shortcuts. We further design probe tasks-long-range pharmacophore prediction, molecular property regression, and functional-group combination classification-to validate that MSC-Mol preserves both modality-specific and synergistic information. Extensive experiments demonstrate that MSC-Mol consistently outperforms existing 2D, 3D, and multimodal pre-training methods on molecular property prediction, drug–target interaction(DTI) tasks, and probe evaluations, highlighting its effectiveness in capturing cross-modal synergy and long-range molecular dependencies. The code is available at https://anonymous.4open.science/r/MSC-Mol-169D.