最近访客

一张照片就能造出专属数字人,CyberVerse开源,实时视频通话首帧仅1.5秒

图片[1]专注工具资源与实战教程一张照片就能造出专属数字人,CyberVerse开源,实时视频通话首帧仅1.5秒专注工具资源与实战教程胖猫小栈
生成摘要
AI 生成,仅供参考

一张照片就能造出专属数字人,CyberVerse开源,实时视频通话首帧仅1.5秒

你有没有想过,搞一个能跟你视频通话的”数字分身”?不用学 3D 建模,不用买动作捕捉设备,就扔一张照片进去,它就能活过来对着你笑、听你说话、跟你聊。

今天要聊的 CyberVerse 就是干这个的。

这东西到底是啥

CyberVerse 是个开源的实时数字人 Agent 框架。说人话就是:你自己部署一套,上传一张照片,就能生成一个能看、能听、能跟你实时视频聊天的数字人。

它不是提前录好的视频,也不是那种一问一答的聊天机器人。它更像打视频电话,你说一句它回一句,中间你还能随时插话打断它。

底层用 WebRTC 传音视频(具体是 Pion 这个 Go 实现),首帧大概 1.5 秒就出来,通话不限时长,延迟也压得比较低。它还自带 TURN / NAT 穿透,意味着你基本不用自己去折腾网络环境。

它能干啥

  • 一张照片造数字人:不用 3D 建模、不用动捕,传张照片就行。面部动画、口型对位、待机时的呼吸感,都是模型实时算出来的。
  • 数字人本身就是 Agent:它不光会陪聊,还能干活。查资料、做调研、出 HTML 报告这类长任务,会被甩给后台的 SubAgent 异步跑,不卡你前面的对话轮次。
  • 模块随便拼:大脑(LLM)、脸、声音、听觉都做成可插拔的模块,改一个 YAML 就能换。默认接阿里云 Qwen、火山引擎豆包,靠 LiteLLM 还能一口气囊括 100 多家大模型。
  • 记得住你:每个角色有独立记忆,对话历史存本地硬盘,下次进来自动接上茬;你也能塞个知识库进去做 RAG 检索增强。

几个关键数字

  • 首帧约 1.5 秒,全双工实时,能打断。
  • 本地模型 FlashHead 1.3B Pro,在双卡 RTX 5090 上能跑 512×512、25+ FPS;LiveAct 18B 在双卡 RTX PRO 6000 上跑 320×480、约 20 FPS。
  • 云端方案(百度星灵、讯飞数字人、Vidu S1)不用本地显卡,画面由云端出。
  • 纯语音模式连数字人那块 GPU 都不用,没独显的机器也能玩。

怎么装、怎么跑

这是个开源项目,GitHub 上直接拉源码:

git clone https://github.com/dsd2077/CyberVerse.git

环境要求:Node 18+(建议 22)、Go 1.25、Conda、Python 3.10+、FFmpeg。装好依赖后开三个终端,分别跑推理服务、API 服务和前端,浏览器打开 http://localhost:5173 就能用。

怕配环境头大的,官方给了云镜像(Compshare、AutoDL),一键起好环境,不用自己装。目前没有打包好的 exe 安装包,就源码和云镜像这两条路子。

项目地址:https://github.com/dsd2077/CyberVerse

值不值得折腾

看你是什么人:

想自己搞个数字人陪聊、做角色还原,或者拿它当语音 Agent 产品的底子,这套挺香——开源、能自托管、模块随便换,自由度很高。

但本地跑”有脸”的数字人挺吃显卡,基本得 5090 这个级别。只想试试水、手里没独显的,用纯语音模式或者云端方案也能跑起来,门槛低不少。

写在最后

整体看,CyberVerse 把”一张照片造个能视频通话的数字人”这件听着很科幻的事,变成了一个普通人能自己部署的开源项目。想动手的现在就能拉源码开搞。

胖猫点评:开源加可插拔这套思路我挺喜欢,就是本地数字人吃显卡这点比较劝退。没卡的兄弟建议先用纯语音模式尝鲜,后面再上云端方案,别一上来就冲显卡。

© 版权声明
THE END
喜欢就支持一下吧
点赞14 分享
评论 抢沙发

请登录后发表评论

    暂无评论内容