给一张静态照片配上一段声音,AI 就能让照片里的人动起来——开口、对口型、点头、眨眼。
两年前这事还得建模、拍棚,现在一张手机截图配段录音,十几秒就出片。
本篇讲清楚它是啥、能干嘛、以及如何上手?
作者 | 听风
编辑/排版 | MM77
翠鸟AI技术漫研 — 拓新AI边界、探索技术增量
01. 这是个啥技术
它有个正经名字,叫音频驱动的数字人(也叫 talking-head、说话头像)。
- 你给它两样东西:
一张人脸照片(正脸、清楚就行,手机随手拍的也可以);
一段声音(你自己的录音,或者用文字合成的语音都行)。
- 它做的事,就是让照片里那张脸照着声音动起来:
说话时嘴型跟着音节走,语气重的地方眉毛会挑一下,还会有自然的点头、眨眼、头部轻微晃动。
最后吐给你一段视频,看上去就像这个人真的对着镜头讲了这段话。

它跟以前的数字人最大的区别是——不用建模、不用训练、不用录棚。
以前做一个能开口的数字人,得三维建模、绿幕拍摄,费时费钱。
现在一张照片就够了,几秒到十几秒出片。
我这次用的是 “xxx Avatar 在线服务”,同类的还有阿里的 EMO、腾讯的一些方案等等,原理都差不多。
02. 实测惊艳√
为了看看到底行不行,我随手截了一张抖音直播间唱歌主播的画面(正脸截图),又找了段十五秒的录音,一起丢给接口。
实测结果如下:
输入 1张手机截图 + 15 秒录音
耗时 大约 18 秒出片
成片 640×640 · 15.8 秒 · 769 KB · 标准 MP4
效果 嘴型跟录音对得上,脸还原得挺准,眼神和头会自然地动
说实话,出片速度和口型的贴合度都超出我预期。一杯水的功夫,照片里的人就开口了。(为保护主播肖像,这里不放生成视频啦,大家可亲自试验下~)
03. 能拿来干嘛
这类技术门槛比较低、出片快,能玩的场景不少:
- 做口播视频:
写好文案 → 合成语音 → 配一张形象照,几分钟出一条讲解 / 带货 / 播报视频,不用真人出镜。
- 虚拟主播 / 客服:
给固定形象配上不同的话术,批量产出问候、通知、答疑视频。
- 让老照片"活过来":
给家里长辈的老照片配段话,让静态照片开口说句祝福,逢年过节很有感觉。
- 多语言内容:
同一个人的形象,换不同语言的配音,一套形象讲多国语言。
- 教育 / 培训:
把课件讲稿转成"老师出镜"的讲解视频,省去反复录制。
......

04. 使用之前的两点提示
实测下来,有两个“小坑”值得提前说一声:
① "免费"要先开个户。
这类服务常写着"公开预览免费",但你通常得先注册、绑定一个账户,系统确认你的身份后才让你用。免费的是用量,不是"不用登记"。
② 生成的视频会带 AI 水印。
我这次的成片底部烙着一行"This digital avatar is generated by AI",去不掉。
这不是产品小气——按中国 2025 年 9 月起施行的规定(《人工智能生成合成内容标识办法》),AI 生成的视频必须打上明确的标识,让人一眼看出这是 AI 做的。
所以拿它做正式内容时,心里要有数:这东西天然带"我是 AI"的标签。

总结
音频驱动的数字人 = 一张照片 + 一段声音 → 一段会说话的视频。
不用建模、不用录棚,十几秒出片;
适合做口播、虚拟主播、让老照片开口;
注意两点:用之前多半要注册开户;成片会带去不掉的 AI 水印。
想自己试的话,找个提供 talking-head / avatar 生成的在线服务(xxxx Avatar、或国内各家的数字人平台)注册一下,传张正脸照、配段声音,就能玩起来了。