MAViD: A Multimodal Framework for Audio-Visual Dialogue Understanding and Generation
Youxin Pang, Jiajun Liu, Lingfeng Tan, Yong Zhang, Feng Gao, Xiang Deng, Zhuoliang Kang, Xiaoming Wei, Yebin Liu
Conference
SIGGRAPH 2026
Audio-Visual Generation
Multimodal Dialogue
Autoregressive Model
Diffusion Model
Talking Human