1
VIB-AVSR: Variational Information Bottleneck for Noise-Robust LLM-Based Audio-Visual Speech Recognition
突破噪声干扰:变分信息瓶颈让大模型音视频语音识别更稳,INTERSPEECH 2026录用论文。
arXiv:2606.29632v1 Announce Type: cross Abstract: Audio-Visual Speech Recognition takes two input modalities, acoustic and visual streams, where visua…