给一张静态照片配上一段声音,AI 就能让照片里的人动起来——开口、对口型、点头、眨眼。

两年前这事还得建模、拍棚,现在一张手机截图配段录音,十几秒就出片。

本篇讲清楚它是啥、能干嘛、以及如何上手?


作者 | 听风

编辑/排版 | MM77

翠鸟AI技术漫研 — 拓新AI边界、探索技术增量


01. 这是个啥技术

它有个正经名字,叫音频驱动的数字人(也叫 talking-head、说话头像)。

  1. 你给它两样东西:

一张人脸照片(正脸、清楚就行,手机随手拍的也可以);

一段声音(你自己的录音,或者用文字合成的语音都行)。

  1. 它做的事,就是让照片里那张脸照着声音动起来:

说话时嘴型跟着音节走,语气重的地方眉毛会挑一下,还会有自然的点头、眨眼、头部轻微晃动。

最后吐给你一段视频,看上去就像这个人真的对着镜头讲了这段话。



它跟以前的数字人最大的区别是——不用建模、不用训练、不用录棚。

以前做一个能开口的数字人,得三维建模、绿幕拍摄,费时费钱。

现在一张照片就够了,几秒到十几秒出片。

我这次用的是 “xxx Avatar 在线服务”,同类的还有阿里的 EMO、腾讯的一些方案等等,原理都差不多。

02. 实测惊艳√

为了看看到底行不行,我随手截了一张抖音直播间唱歌主播的画面(正脸截图),又找了段十五秒的录音,一起丢给接口。

实测结果如下:

输入 1张手机截图 + 15 秒录音

耗时 大约 18 秒出片

成片 640×640 · 15.8 秒 · 769 KB · 标准 MP4

效果 嘴型跟录音对得上,脸还原得挺准,眼神和头会自然地动

说实话,出片速度和口型的贴合度都超出我预期。一杯水的功夫,照片里的人就开口了。(为保护主播肖像,这里不放生成视频啦,大家可亲自试验下~)

03. 能拿来干嘛

这类技术门槛比较低、出片快,能玩的场景不少:

  1. 做口播视频:

写好文案 → 合成语音 → 配一张形象照,几分钟出一条讲解 / 带货 / 播报视频,不用真人出镜。

  1. 虚拟主播 / 客服:

给固定形象配上不同的话术,批量产出问候、通知、答疑视频。

  1. 让老照片"活过来":

给家里长辈的老照片配段话,让静态照片开口说句祝福,逢年过节很有感觉。

  1. 多语言内容:

同一个人的形象,换不同语言的配音,一套形象讲多国语言。

  1. 教育 / 培训:

把课件讲稿转成"老师出镜"的讲解视频,省去反复录制。

......



04. 使用之前的两点提示

实测下来,有两个“小坑”值得提前说一声:

① "免费"要先开个户。

这类服务常写着"公开预览免费",但你通常得先注册、绑定一个账户,系统确认你的身份后才让你用。免费的是用量,不是"不用登记"。

② 生成的视频会带 AI 水印。

我这次的成片底部烙着一行"This digital avatar is generated by AI",去不掉。

这不是产品小气——按中国 2025 年 9 月起施行的规定(《人工智能生成合成内容标识办法》),AI 生成的视频必须打上明确的标识,让人一眼看出这是 AI 做的。

所以拿它做正式内容时,心里要有数:这东西天然带"我是 AI"的标签。



总结

音频驱动的数字人 = 一张照片 + 一段声音 → 一段会说话的视频。

不用建模、不用录棚,十几秒出片;

适合做口播、虚拟主播、让老照片开口;

注意两点:用之前多半要注册开户;成片会带去不掉的 AI 水印。


想自己试的话,找个提供 talking-head / avatar 生成的在线服务(xxxx Avatar、或国内各家的数字人平台)注册一下,传张正脸照、配段声音,就能玩起来了。