1
SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment
一张图胜过千言万语,但更聪明的做法是只保留最关键的部分——看SEPS如何给视觉模型“瘦身”还能对齐得更准。
arXiv:2511.01390v2 Announce Type: replace-cross Abstract: Fine-grained cross-modal alignment aims to establish precise local correspondences between v…