做短视频的朋友大概都有过这种经历:一条口播视频,化妆、背稿、找场地、调灯光,折腾大半天。请个真人主播,月薪又是大几千,中小商家根本扛不住。
所以数字人工具这两年特别火。但市面上的商用平台,年费动辄几千上万,换个形象还要加钱。直到我在 GitHub 上翻到这个项目,才觉得数字人这事真的能低成本落地。它叫 AUTOavantar,在国内常被叫做”智影工坊”。
这里先说一句容易踩坑的:它跟腾讯那个”智影”不是一回事。腾讯智影 2025 年就已经停服注销了,而 AUTOavantar 是独立开发者维护的开源工程,代码完全公开,可以自己部署在自己电脑或服务器上。
它到底能干什么
简单说,它是一个”数字人视频工厂”。你准备好文字内容,系统自动帮你生成一段带数字人出镜的短视频,连字幕和背景音乐都能一并搞定。
它把原本要切好几个软件的工作串在了一个网页界面里:
- 文案生成:接了大模型,丢几个关键词进去就能自动出稿,也能直接粘贴现成文案,系统会自动分段,每段对应一个镜头。
- 语音克隆:内置 IndexTTS 引擎,上传一段 5 到 10 秒的参考音频,就能克隆你的音色,语速快慢、情绪起伏都能调。
- 数字人驱动:底层是 HeyGem ONNX,唇形同步精度挺高,侧脸或光线复杂点也能对上。还支持 GFPGAN 人脸增强,画面糊一点也能救回来。
- 后期合成:开场、循环、结尾自动拼接,BGM、字幕、转场一并搞定,默认输出 1080P、30 帧。
![图片[2]专注工具资源与实战教程智影工坊 AUTOavantar:本地 0 元做数字人视频专注工具资源与实战教程胖猫小栈](https://www.4bot.cn/wp-content/uploads/2026/09/4798e7674d20260901224050.webp)
实际使用流程
我翻了项目文档和几个部署帖,整套流程跑下来大致是这样:
第一步,建一个数字人角色。上传你的开场视频、循环视频,再传一段参考音频做音色克隆,系统会做面部分析,自动识别你的脸。
第二步,写文案。可以用 AI 生成,也可以自己贴。文案会自动分段,每段对应一个镜头。
第三步,创建渲染任务。选好角色、场景素材、BGM,点提交。系统自动走完全流程:TTS 生成语音、HeyGem 驱动唇形、视频合成、加字幕。进度通过 WebSocket 实时推到页面上,你能看着它一点点跑完。
第四步,导出成片。分辨率、帧率在配置文件里能改,默认 1920×1080、30 帧。
怎么装起来
项目提供了两种玩法。
新手最省心的是一键整合包:作者把环境和模型都打包好了,Windows 用户下载 autoavantar.exe 双击就能启动,后续有更新程序会自己提醒。
愿意折腾的可以手动部署,需要准备:Python 3.10 以上、Node.js 18 以上、CUDA 11.8 以上,以及一块 NVIDIA 显卡。显存至少 4GB,能跑完全部任务,但会比较慢;6GB 以上就舒服多了。配置大模型 Key 在 config/api_keys.yaml 里,默认支持 DeepSeek 和阿里云,填上自己的就行。
提醒一句:项目里作者留了一个自带 Key 说是自己充的钱,千万别拿去狂刷。另外 20 系以下的老显卡(比如 GTX 10 系列)用不了封面生成功能,但核心功能不受影响。
源码地址放这里,自己去拉:
https://github.com/Eikwang/AUTOavantar
![图片[3]专注工具资源与实战教程智影工坊 AUTOavantar:本地 0 元做数字人视频专注工具资源与实战教程胖猫小栈](https://www.4bot.cn/wp-content/uploads/2026/09/14f022124820260901224100.webp)
优点和缺点,我都列一下
先说优点。免费,这是最实在的。数据全在本地,素材、数字人形象、音色模型都归你自己,不用担心平台哪天涨价或者跑路。代码完全开放,有技术能力的团队能拿去做二次开发,改成适合自己行业的版本。批量任务队列也很实用,一次性扔进去几十条渲染任务,它自己排队处理。
缺点也得讲清楚,免得你满怀希望拉下来发现不是那么回事。
情感表达这块,IndexTTS 已经很强了,但跟真人比还是少了点烟火气。复杂肢体动作目前主要靠素材视频驱动,想做大幅度舞蹈或者武术动作,暂时不现实。部署有环境依赖门槛,没有 N 卡基本玩不转,社区支持为主,遇到问题得自己翻 Issue,响应速度肯定比不上商业产品。
除了自部署,还有云端版
如果你不想折腾环境,也有个现成的云端版本,官网是:
https://www.shpy.top/
它和开源版用的是同一套思路,但不用自己装,注册就能用。免费试用版每月 5 个积分(约 3 分钟视频)、720P、带平台水印,不能商用;基础版 99 元/月,高级版 299 元/月,支持声音克隆和 API 调用。说白了就是花钱买省事,适合完全不想碰命令行的朋友。
![图片[4]专注工具资源与实战教程智影工坊 AUTOavantar:本地 0 元做数字人视频专注工具资源与实战教程胖猫小栈](https://www.4bot.cn/wp-content/uploads/2026/09/03c509a0d020260901224108.webp)
写在最后
数字人视频这个赛道今年特别卷,开源项目层出不穷,但能把”文案 → 语音 → 数字人 → 剪辑 → 字幕”整条链路串起来的,确实不多见。AUTOavantar 算其中一个,普通人也能玩得转。
合规提醒一句:本地部署请遵守项目 LICENSE 与开源协议,素材和克隆形象注意版权;云端版明确禁止生成违法违规内容,别拿去乱用。另外数据自主也意味着责任自负,生成的内容自己要把关。
如果你手头有块闲置的 N 卡,或者本身就是技术出身想试水数字人赛道,这个项目值得拉下来折腾一下。就算不商用,拿来搞懂数字人 pipeline 的完整流程,也挺值。
我是胖猫,在“胖猫小栈”聊聊好玩的 AI 工具和开源项目。
本站收集的资源仅供内部学习研究软件设计思想和原理使用,学习研究后请自觉删除,请勿传播,因未及时删除所造成的任何后果责任自负。
如果用于其他用途,请购买正版支持作者,谢谢!若您认为「 胖猫小栈 」发布的内容若侵犯到您的权益,请联系站长邮箱: botcn@hotmail.com 进行删除处理。
本站资源大多存储在云盘,如发现链接失效,请联系我们,我们会第一时间更新。










暂无评论内容