2023年之前,如果你想做一个数字人说话的视频,流程大概是这样的:先拍一段人物视频,再用算法把嘴型对上新的音频,画面里的人还是那个人,只是嘴巴被"偷梁换柱"了。
这套流程有个前提,你必须先有一段视频素材。
2025年,Captions公司发布的Mirage打破了这个前提。
(资料图片)
给它一段音频,它直接生成一整段说话的视频,连视频素材都不需要。这句话听起来平平无奇,但你把它拆开想一想,会发现这其实是个挺离谱的要求:声音里根本没有"脸长什么样""嘴怎么动""眼神往哪看"这些信息,凭什么能从一段波形反推出一张会说话的脸?
这就是Mirage要解决的核心问题。
核心问题:声音里到底藏着多少视觉信息
在Mirage之前,这个领域已经卷了好几年。
2020年的Wav2Lip
Wav2Lip:一种早期的音频驱动唇形同步方法,输入一段人物视频和一段新音频,把嘴型改成和新音频匹配。
已经能做到嘴型基本对得上,但代价是画面僵硬,人物只能是"半身像+固定背景",稍微一动就露馅。之后几年里,SadTalker、EMO、VASA-1这些工作陆续把效果往前推,表情更自然了,头部能小幅度转动了,但有个共同的限制一直没突破:它们都需要一张参考图像或一段参考视频作为起点,本质上还是在"改造"已有的画面,而不是"无中生有"。
这就好比你请一个模仿秀演员,给他一张照片和一段录音,他能把嘴型对上,眼神学得像。但如果你什么照片都不给,只给他一段声音,让他凭空演出一个人的整张脸和全身动作,这个难度完全不是一个量级。
Mirage要做的就是后面这件更难的事。
从声音到画面:跨模态注意力机制
Mirage的核心架构是一个基于扩散模型的生成系统。
扩散模型:一种生成模型,工作原理是先把一张清晰图像逐步加噪声直到变成纯噪声,再训练一个网络学会反过来一步步去噪,从噪声中还原出清晰画面。生成新内容时,就是从一堆随机噪声出发,让网络按学到的规律去噪,最后"去"出一张新图。
问题来了,去噪的过程要往哪个方向走,总得有个指挥。在文生图里,这个指挥是文字描述。在Mirage里,这个指挥变成了音频本身。
具体做法是引入跨模态注意力机制。
跨模态注意力:一种让模型在生成图像时,主动去"参考"另一种模态数据(比如音频)特征的机制。生成视频的每一帧时,模型会去看当前时刻的音频特征长什么样,然后据此调整生成的嘴型、表情和头部动作。
这里有个细节值得说清楚,音频不是被当成一个整体扔给模型的,而是按时间切成一段一段,和视频的每一帧精确对齐。哪一秒的音强高了,嘴巴张得就大一点,哪一秒有停顿,嘴唇就自然闭合。
这个机制像什么呢?
它有点像同声传译现场的口型配音演员。演员事先完全不知道说话人下一句要说什么,但他必须一边听一边配,声音落在哪个音节,嘴型就要精确卡在哪个音节上,晚半拍观众都会觉得别扭。如果没有这种逐帧对齐的机制,模型生成的嘴型就会变成"大概齐"式的模糊摆动,像小时候看过的粗糙配音动画,声音和嘴巴各演各的,一眼就能看出假。
时序一致性:不让人"抽风"
光有音画对齐还不够,视频是连续的很多帧,前一帧生成的脸和后一帧生成的脸,得是同一张脸。
这就涉及到时序一致性问题。
时序一致性:指生成的视频在时间维度上保持连贯,人物的身份特征、背景环境、动作轨迹不会突然跳变或抖动。
扩散模型天生的问题是,它对每一帧的生成都带有一定随机性,如果不加约束,逐帧独立生成的结果会像老式数码相机连拍出来的照片,张张都不错,拼在一起播放却像鬼畜。Mirage的做法是让模型在生成当前帧时同时参考前后相邻帧的信息,把单帧生成变成一个带记忆的连续过程。
这就好比拍一部定格动画。
如果动画师每拍一张照片都完全凭感觉摆放人偶,不参考上一张的姿势,那播放出来的动画里,人偶会一会儿在左边一会儿在右边,观众看到的是抖动和跳跃,而不是流畅的走路动作。定格动画师之所以每拍一张都要对照上一张微调几毫米,就是为了保证连续播放时动作是顺滑的。Mirage在生成层面做的是同一件事,只是把"人工对照"换成了模型内部的时序建模。
从半身到全身:生成范围的扩展
前面提到的Wav2Lip等方法大多局限在人脸和半身,原因很直接,脸部区域小、动作幅度有限,建模难度相对可控。一旦要生成全身,手势、身体姿态、衣服褶皱的运动都要跟着声音的情绪和节奏走,复杂度直接上一个台阶。
Mirage在这一点上往前迈了一步,它的生成范围不再局限于面部特写,而是覆盖了包含肢体动作的更完整的画面。这意味着模型不仅要学会音频和嘴型的对应关系,还要学会音频的情绪强弱和肢体动作幅度之间的隐含联系,声音激动的时候手势会更大,声音平缓的时候身体姿态会更松弛。
这种全身生成能力解决的是一个实际问题,过去做数字人视频,半身像用在直播场景还凑合,一旦用在正式的宣传片或者虚拟主播场景,观众会本能地注意到画面为什么永远是固定构图、上半身以下全靠猜。全身可动的生成结果,才更接近真实拍摄的观感。
数据说话:和已有方法比到底强在哪
下面这张对比表格,呈现的是Mirage类方法与几种代表性前作在关键指标上的表现差异。
| 方法 | 是否需要参考视频 | 唇形同步精度(LSE-D,越低越好) | 视频质量(FID,越低越好) | 生成范围 |
| Wav2Lip(2020) | 需要 | 较高 | 一般 | 仅嘴部区域 |
| SadTalker(2023) | 需要 | 中等 | 较好 | 面部+轻微头动 |
| EMO(2024) | 需要 | 较低 | 好 | 面部表情丰富 |
| VASA-1(2024) | 需要 | 较低 | 好 | 面部+头部姿态 |
| Mirage(2025) | 不需要 | **最低** | **最好** | **全身可动** |
这张表格里最关键的一列其实不是那几个指标数字,而是最左边那一栏,是否需要参考视频。
这一栏的差异意味着,前面几种方法解决的是改造已有素材的问题,Mirage解决的是从零生成的问题,这是两类不同难度的任务,而Mirage是在更难的任务设定下,依然在音画同步和画面质量上做到了不逊色甚至更优的水平。
这件事的分量不亚于当年从图生图跨越到文生图。图生图时代,大家已经把改图做得很精细了,直到文生图出现,大家才意识到原来可以完全跳过原图这一步。Mirage在音频驱动视频生成这个细分领域里,走的是同样的跨越路径。
后续影响:这条路上还有谁在跑
Mirage发布之后,这个方向明显热闹了起来。
同一时期,快手的Loopy在2024年就已经在探索去掉显式的头部姿态控制信号,让模型完全从音频里自己学出自然的头部运动,这和Mirage减少外部输入依赖的思路是一致的。微软的VASA-1则把重点放在实时性上,尝试把生成速度压缩到接近实时对话的响应速度,这是Mirage目前还没有完全解决的问题,毕竟全身生成加扩散模型的组合,计算量本身就不小。
可以预见的是,接下来这个赛道会往两个方向继续分化,一个是往更快的实时方向卷,另一个是往更长时长、更复杂场景的方向卷,比如多人同框对话、复杂背景下的全身生成。这两个方向Mirage目前都还有明显的提升空间。
写在后面
看完这类工作,最触动我的其实不是效果多逼真,而是一个很朴素的事实,声音里包含的信息量,可能比我们直觉认为的要多得多。
我们平时觉得"听声音"和"看画面"是两件独立的事,但Mirage这类模型的存在说明,一段音频里其实隐含了大量关于说话人状态的信息,情绪强弱、语速节奏、停顿位置,这些都能被模型学出来并映射成对应的画面动作。这让我想到盲人用回声定位判断周围环境的能力,信息从来不是只存在于它最直观的那个感官通道里,只是我们平时懒得去挖。
Mirage还没解决的问题是长时间生成的稳定性,几十秒内的效果不错,但如果要生成几分钟的连续视频,身份漂移和动作重复的问题会不会重新冒出来,这个我很好奇,也没在公开资料里看到明确答案。
Q&A
Q1:Mirage是什么?
A:Mirage是由Captions公司开发的AI视频生成模型,它的核心能力是仅通过音频就能生成完全匹配的说话视频,不需要预先准备参考视频素材。
Q2:Mirage和Wav2Lip、SadTalker这类方法有什么区别?
A:Wav2Lip、SadTalker等方法都需要先有一段参考视频或图像,再用音频去改造嘴型和表情。Mirage不需要参考视频,直接从音频生成包含全身动作的完整视频,任务难度和技术路线都不一样。
Q3:Mirage会不会取代真人视频制作?
A:目前不会完全取代,但会大大改变视频制作方式,尤其是在数字人、虚拟主播这类不需要真实拍摄场景的应用中影响明显。











