SOTAlign requires 4x less paired supervision, consistently improves as more unpaired samples are added, remains robust under distribution shifts between paired and unpaired data, and outperforms supervised and semi-supervised baselines in zero-shot classification and retrieval.