Just-Dub-It: Video dubbing via Joint Audio-Visual Diffusion
Tel Aviv University; Lightricks
一句话总结
把视频配音(把说话视频翻译成另一种语言、同时保持人物身份与唇形同步)重新表述为”单个音视频扩散模型上的联合生成任务”,只用一个轻量 LoRA 就让预训练音视频基础模型同时生成翻译后的语音和同步的面部动作。
研究背景
- 领域现状:图像、视频、音频生成模型近年进步显著,最近还出现了能在单个生成过程里联合建模声音与画面的音视频基础模型(如 LTX-2、Ovi)。视频配音正是这类先验的理想下游任务。
- 核心痛点:现有配音方法大多把问题拆成”语音合成 + 音频驱动的面部编辑”等一串专用模块。这类流水线复杂且脆弱,每个组件都对输入做了强假设,在真实视频(说话人相对镜头移动、有笑声/叹气等非语音声音、嘴部被遮挡)里容易崩。更关键的是,模块化系统通常把说话人声音从背景音里剥离出来”真空翻译”,忽略了说话人与环境之间的时序—语义依赖:翻译后语音时长一变,简单重叠回原背景音就会失同步(比如狗叫本该回应说话人、关门声本该发生在特定时刻),破坏观众沉浸感。
- 本文 idea:不做模块拆分,而是把整段音视频流当成一个生成任务,直接微调一个音视频扩散模型来做配音,让音频与视觉线索在跨模态注意力层里互相”通气”、共同生成。适配是轻量的——只在强生成先验上加一个小 LoRA。为解决”没有配对多语训练数据”的难题,作者用生成模型自身合成配对数据。
方法
整体框架:方法建立在 LTX-2 这个把视频和音频当作统一信号处理的音视频基础模型之上(它用非对称双流 DiT、3D VAE 编码视频、1D VAE 编码音频,靠双向交叉注意力保持音视对齐,并以 Flow Matching 训练)。作者不直接拿它做配音,而是分两步:先用它的生成能力合成”身份一致的双语配对训练数据”,再用一个轻量 In-Context LoRA 学出受约束的编辑行为,从而在推理时做精确、时序对齐的配音。
flowchart LR
A["输入:源音视频对 + 目标译文文本"] --> B["拼接:干净上下文对 + 加噪目标对"]
B --> C["冻结的 AV-DiT + 可训练 LoRA"]
C --> D["Modality-Isolated 交叉注意力掩码"]
D --> E["联合去噪:生成翻译语音 + 同步唇部动作"]
E --> F["输出:配音视频,保留身份/背景/环境音"]
关键设计分四点:
-
用生成模型自造配对数据(核心难点)。真实世界不存在”同一说话人、同一语义、多语言、且姿态光照身份背景完全一致”的完美配对。作者先生成”语言切换视频”——一个连续镜头里同一说话人自然地从英语切到法语,这样两种语言下的身份天然一致;再在语言切换处切成两半,对其中一半的人脸区域和音频加噪、然后在另一半的全局音视上下文条件下去噪重建,得到内容对齐的双语配对数据。虽然数据大多是”同内容不同语言”,却足以让模型泛化到多种编辑任务(含同语言编辑、未见过的语言对翻译)。
-
化解”身份—发音”权衡。裸做音频 inpainting 有个根本矛盾:从零去噪会 voice drift(丢失说话人音色);只以源语言音频为条件又会 prosody leakage(目标文本被套上源语言的韵律节奏)。作者的解法是让生成同时以”一段既保留说话人音色、又带目标语言语音风格的参考片段”为条件,两头兼顾。
-
Latent-Aware Fine Masking(潜空间精细掩码)。免训练 inpainting 的一个坑是模型会”偷看”原始唇动:视频 VAE 编码器感受野很大(如 32×32×8),唇区像素信息会渗进周围(下巴、脸颊)token,即使唇部 token 被完全加噪,相邻未掩码 token 仍残留原始唇轨迹”回声”,模型据此就能平凡地重建原动作。作者通过比较”掩码 vs 未掩码输入”在潜空间的残差差异,实证出”有效潜掩码”,把信息扩散的完整范围都盖住,强迫模型从头依据生成的音频重建面部区域。此外还用 Lip Augmentation:合成数据里 viseme 有歧义(不同音素唇形相近、易出”含糊嘟囔”的唇动),于是额外用”逐字母夸张发音(A..B..C)”的提示生成视觉上更有区分度的唇动;每段做两次 inpainting——一次无增强得到正确译音、一次带增强得到多样唇动,再合并作训练上下文。
-
In-Context LoRA + Modality-Isolated 交叉注意力。把编辑表述为条件生成:给定源音视对与目标文本,模型学习只改唇形与相关语音、其余上下文(视觉与声音身份、环境)保持不变。训练时冻结基座、只优化注入自注意力/交叉注意力的低秩 LoRA,最小化 flow-matching 目标。为让上下文与目标对齐,给上下文 token 赋予与目标一致的位置编码(Context-Aligned Multimodal Positional Encoding),把配音重构成”上下文感知的补全”而非盲翻译。同时在跨模态注意力里加结构化掩码 \(M\):
\[\text{Attention}(Q,K,V)=\text{Softmax}\left(\frac{QK^{T}}{\sqrt{d_k}}+M\right)V\]
其中当查询与键都属于两模态的目标(含噪)token 时 \(M_{i,j}=0\),否则为 \(-\infty\)。这样含噪音频只与含噪视频互相注意、各模态仍可参考自身源 token 取身份线索,避免”含噪信号被另一模态干净上下文误导”的信号泄漏,也顺带消解了 Lip Augmentation 引入的音视不同步。
实验结果
在 HDFT、TalkVid 两个偏正面/受控的基准,以及作者自建的”挑战集”(25 段 YouTube 真实视频 + 25 段合成视频,含侧脸、大幅姿态变化、遮挡、风格化外观)上评测。视觉侧对比 LatentSync、MuseTalk(均配 CosyVoice 生成译音),音频侧对比 CosyVoice、OpenVoice,并与闭源商业方案 HeyGen 做用户研究。
主实验(视觉质量与音视同步):
| 方法 | 数据集 | Succ↑ | CSIM↑ | FVD↓ | MAR Div.↑ | ASync↓ |
|---|---|---|---|---|---|---|
| LatentSync + CosyVoice | Easy | 100% | 0.8762 | 260.98 | 0.1043 | 0.05 |
| MuseTalk + CosyVoice | Easy | 100% | 0.7937 | 272.96 | 0.0988 | 0.70 |
| Ours (Unified) | Easy | 100% | 0.8471 | 131.88 | 0.1168 | 2.21 |
| LatentSync + CosyVoice | Hard | 80% | 0.7070 | 758.66 | 0.1335 | 1.34 |
| MuseTalk + CosyVoice | Hard | 74% | 0.5770 | 902.03 | 0.1131 | 5.65 |
| Ours (Unified) | Hard | 100% | 0.6455 | 353.54 | 0.1461 | 2.44 |
要点:本文在所有数据集上 FVD 最低(时序连贯性最好),生成成功率始终 100%,而基于掩码的基线在挑战集掉到 80%/74%(侧脸或非人主体检测不到脸就完全无输出)。CSIM 与 SOTA 模块化流水线相当;FID 偏高是全帧 VAE 编解码的预期代价(换来对任意角色/非正面/非人物体的鲁棒泛化);MAR 更高说明唇部articulation更自然,避免了 inpainting 方法的”嘟囔”。音频侧(Tab.2)本文时长误差 Dur-Err 最低、强度相关 Int-Corr 最高——因为有视觉 grounding 能压缩/拉伸语音去匹配镜头时长,避免”结尾错位/画面倒放”伪影;WER 与音色相似度有竞争力但受基座能力上限约束。SyncNet 偏移稳定在约 1–2 帧(感知不可察),作者指出基线的近零偏移可能是对 SyncNet 在正面样本上的过拟合。用户研究中本文在唇同步、提示遵从、整体质量三项上均优于 LatentSync 与 HeyGen。
消融(Tab.3):去掉 LoRA(零样本 in-context)或去掉 Lip Augmentation,都会暴露同一失效模式——模型退化成”直接重建源视频”,表现为虚高的 ID-SIM/V-SIM 但近乎随机的 WER;完整模型 WER 显著更低、唇部关键点距离 LMD 更高,证明它生成的是新的、贴合提示的唇动而非复制源轨迹。两项设计共同打破”重建偏置”。
亮点与局限
- 亮点:
- 把配音从”多模块拼接”范式转成”单模型联合生成”,让语音、面部动作、场景动态在统一先验下共同演化,天然保留环境音与说话人-场景交互(狗叫回应手势、边吃边说等),并自动匹配原视频时长。
- 免掩码、免显式人脸跟踪,对侧脸、遮挡、非人角色、风格化外观都鲁棒(100% 成功率)。
- 用生成模型自造双语配对数据的思路巧妙,配合 Latent-Aware Fine Masking、Lip Augmentation、Modality-Isolated Cross-Attention 三个针对性机制解决数据泄漏与音视不同步。
- 适配极轻量,只训练 LoRA。
- 局限:
- 并非所有情况都能完美保留说话人音色,作者指出需要更强的”语言内容 vs 声音风格”解耦或更显式的身份监督。
- WER、音色相似度受基座音视模型能力上限约束。
- FID 高于以人脸为中心的基线(全帧编解码的代价)。
- 目前面向较短时序,长时序与更丰富的对话场景是未来方向。
延伸思考
这项工作是”音视频基础模型 + 轻量 in-context 适配”范式在复杂多模态编辑上的一个有说服力的案例:与其为每个子任务堆专用模块,不如让一个联合先验统一承担,靠数据合成 + LoRA 把通用生成能力”约束”成特定编辑行为。其中”用生成模型造出现实里不存在的完美配对数据”以及”用潜空间残差实证出有效掩码来堵住 VAE 感受野泄漏”两点,思路可迁移到其他缺配对数据、又受编码器信息泄漏困扰的编辑任务(如物体替换、局部重打光)。值得追问的是:联合建模在更长上下文下的稳定性、音色身份解耦的显式监督如何引入、以及对基座模型能力的强依赖是否会随基座迭代而线性受益。