Ditto + WebRTC
优先验证路线
适合正脸视频通话、嘴型、眨眼、表情和小幅头部运动;服务器成本和画面效果相对平衡。但真正的难点是把模型稳定接入网页实时视频通话。
预计总工期27–41 人日
建议生产月预算约 1500–4000 元起
客户决策版|2026 年 9 月 17 日
本文只比较“逝去亲人照片如何生成实时数字人视频画面”。现有豆包语音链路、声音克隆、人物设定和业务系统继续保留,不在本轮重做范围内。
建议先用同一组真实照片,同时验证 Ditto 与 SoulX-FlashHead Lite,再决定正式路线。
优先验证路线
适合正脸视频通话、嘴型、眨眼、表情和小幅头部运动;服务器成本和画面效果相对平衡。但真正的难点是把模型稳定接入网页实时视频通话。
预计总工期27–41 人日
建议生产月预算约 1500–4000 元起
高质量候选
画面整体自然度上限最高,最接近真正视频通话;但需要 RTX 4090 级别显卡,部署与维护成本最高,也更容易出现“某些五官不像本人”的生成风险。
预计总工期25–38 人日
建议生产月预算约 2000–4500 元起
显卡要求RTX 4090 级别显卡
低成本兜底
开发和服务器成本较低,但它主要替换嘴部;每个角色还要额外制作待机视频,长时间通话可能出现动作重复。
预计总工期22–33 人日
建议生产月预算约 900–2500 元起
对这个项目,评估优先级不应是“动作是否丰富”,而应是:
像不像本人 > 长时间是否稳定 > 嘴型与声音是否同步 > 轻微表情与转头 > 帧率 > 大动作。
这是因为逝去亲人数字人一旦出现牙齿、嘴唇、眼神、皱纹或脸型明显变化,家属通常会比普通数字人用户更敏感。
本文件的时间、费用和服务器建议均基于以下前提:
| 项目 | 本轮处理方式 |
|---|---|
| 用户、管理员、人物设定、通话记录 | 继续使用现有系统 |
| 豆包语音与声音克隆 | 继续使用现有链路 |
| 新增能力 | 音频实时驱动人物视频画面,并在网页中播放 |
| 初期并发 | 只承诺一路稳定通话;多路并发必须另行压测 |
| 使用环境 | 桌面 Chrome 为优先目标 |
| 工期口径 | 一名开发者全职投入;包含规划、开发、调试、测试和首次部署 |
不包含:高可用双机、移动端深度适配、微信小程序改造、大规模并发、备案咨询、需求中途新增及研发人工单价。
建议在下文工期之外保留约 20% 风险缓冲,用于显卡驱动、CUDA、TensorRT、浏览器兼容和网络问题。
| 比较项 | FlashHead | Ditto | MuseTalk |
|---|---|---|---|
| 通俗理解 | 连续生成整个人物画面 | 让照片中的脸随音频运动 | 播放待机视频并替换嘴部 |
| 视觉效果上限 | 最高 | 较高 | 中等 |
| 一张照片直接建角色 | 支持 | 支持 | 不完整支持,仍需待机视频 |
| 前期集成难度 | 高 | 高,WebRTC 接入最难 | 中等 |
| 预计总工期 | 25–38 人日 | 27–41 人日 | 22–33 人日 |
| 建议生产月预算 | 约 2000–4500 元起 | 约 1500–4000 元起 | 约 900–2500 元起 |
| 新增一个角色 | 图片检查与效果验收 | 图片检查与效果验收 | 还要制作并检查待机视频 |
| 最大失败风险 | 五官、牙齿等细节被生成错 | 离线能生成,在线实时视频流不稳定 | 动作重复,且只有嘴部明显运动 |
| 建议定位 | 高质量方向 | 优先验证方向 | 低成本兜底方向 |
← 左右滑动查看三个方案 →
三种方案并不是简单的“贵、中、便宜”。它们只是把成本放在了不同地方:
上传一张人物照片后,系统根据实时音频连续生成整个头像画面。嘴部、眼睛、表情和小幅头部运动都会变化,三种方案中最接近真正的视频通话。
建议不替换已经完成的豆包链路:现有链路输出音频,FlashHead 负责输出人物画面,浏览器继续作为通话界面。OpenAvatarChat 可以作为参考或改造基础,不建议为了接入它而重做整个业务系统。
| 可能失败点 | 客户看到的现象 | 上线前必须做的处理 |
|---|---|---|
| 身份细节被补错 | 牙齿、嘴唇、眼睛或侧脸不像本人 | 限制大角度转头和夸张表情;用真实照片逐人验收 |
| 长时间生成漂移 | 说得越久越不像本人 | 做 10 分钟和 30 分钟连续测试,记录失败时间点 |
| 实际速度低于 Demo | 卡顿、掉帧、声音先播画面未跟上 | 模型、编码、推流和业务系统一起压测 |
| 4090 节点不可用 | 服务无法启动或临时停机 | 固化镜像、保存模型副本、明确恢复步骤 |
| 依赖升级破坏环境 | 更新后突然无法启动 | 固定版本,先在测试环境升级 |
← 左右滑动查看更多 →
| 阶段 | 预计投入 | 主要产出 |
|---|---|---|
| 方案规划与技术验证 | 4–6 人日 | 跑通模型、确认照片规格、验证音频驱动 |
| 实际开发与系统接入 | 10–15 人日 | 角色创建、会话启动释放、浏览器播放、异常处理 |
| 调试与测试 | 8–12 人日 | 老照片、音画同步、断线、显存及稳定性测试 |
| 首次生产部署 | 3–5 人日 | 固定环境、日志监控、备份、证书和网络端口 |
| 合计 | 25–38 人日 | 约 5–8 周,不含风险缓冲 |
← 左右滑动查看更多 →
| 成本项目 | 预算参考 | 说明 |
|---|---|---|
| 技术验证算力 | 约 300–800 元 | 先按小时租用 4090 做验证 |
| GPU 基础价格示例 | 约 1295 元/月 | 2026-09 价格页中 4090 24GB、16 核、64GB 包月快照,仅作算力参考 |
| 建议生产月预算 | 约 2000–4500 元/月起 | 包含 GPU、业务服务器、存储、监控、备份、TURN 中继和一定流量 |
| 常规维护 | 约 1.5–3 人日/月 | 日志、驱动异常、证书、备份和恢复演练 |
| 新增角色 | 约 0.25–0.75 人日/个 | 图片清洗、生成测试、相似度检查、客户确认 |
← 左右滑动查看更多 →
| 项目 | 建议配置 | 原因 |
|---|---|---|
| GPU | RTX 4090 24GB | 以官方实时数据使用的卡型为起点 |
| CPU | 16 核左右 | 视频编码和实时推流也占用 CPU |
| 内存 | 64GB | 给模型、服务和缓存留余量 |
| 硬盘 | 200GB 以上 NVMe | 模型、镜像、日志和角色资源 |
| 系统 | Ubuntu 22.04 LTS | 固定驱动、CUDA 和依赖版本 |
| 网络 | 固定公网 IP、20Mbps 以上、支持 UDP | 一路通话起点;复杂网络需要 TURN |
← 左右滑动查看更多 →
演示:石雕女
石雕女.mp4
视频未能加载。
演示:欧美女
欧美女.mp4
视频未能加载。
上传一张照片后,系统根据音频驱动嘴型、表情、视线和小幅头部运动。它适合正脸、轻微点头、小角度转头和视频通话构图;不适合大幅侧脸、全身动作、自由镜头或 360 度人物。
Ditto 的最大难点不是“能否生成一段视频”,而是“能否在用户通话时持续稳定地生成、编码、同步并传到浏览器”。
| 可能失败点 | 客户看到的现象 | 上线前必须做的处理 |
|---|---|---|
| 只跑通离线生成 | 能导出视频,却无法实时通话 | 把 WebRTC 实时闭环作为第一阶段验收 |
| TensorRT 不兼容 | 换服务器后模型无法启动 | 在最终采购 GPU 上重新生成并保存 engine,固定驱动版本 |
| 帧缓存堆积 | 通话越久画面越落后 | 设置丢帧和背压策略,监控实时队列长度 |
| 网络连接失败 | 部分家庭或公司网络黑屏 | 配置 STUN/TURN,测试移动网络、宽带和防火墙 |
| 照片姿态不合格 | 侧脸或低头照片拉扯、变形 | 上传前检查并拒绝不合格照片 |
← 左右滑动查看更多 →
| 阶段 | 预计投入 | 主要产出 |
|---|---|---|
| 方案规划与技术验证 | 4–6 人日 | 跑通模型,确认 GPU 与 TensorRT 兼容性 |
| 实际开发与系统接入 | 12–18 人日 | 实时帧输出、视频编码、WebRTC、音画同步、会话管理 |
| 调试与测试 | 8–12 人日 | 不同照片、网络波动、断线、内存显存和稳定性测试 |
| 首次生产部署 | 3–5 人日 | 固化模型、驱动、监控、自动恢复、端口和证书 |
| 合计 | 27–41 人日 | 约 6–9 周,实时接入不确定性最高 |
← 左右滑动查看更多 →
| 成本项目 | 预算参考 | 说明 |
|---|---|---|
| 技术验证算力 | 约 250–700 元 | 可先按小时租 3090 或 4090 |
| GPU 基础价格示例 | 约 720–1295 元/月 | 3090 或 4090 同等级实例快照 |
| 建议生产月预算 | 约 1500–4000 元/月起 | 包含 GPU、业务服务器、存储、监控和实时通信中继 |
| 常规维护 | 约 1.5–3 人日/月 | 重点维护 WebRTC、TensorRT、显卡驱动和会话释放 |
| 新增角色 | 约 0.25–0.75 人日/个 | 图片清洗、预处理和相似度验收 |
← 左右滑动查看更多 →
| 项目 | 建议配置 | 原因 |
|---|---|---|
| GPU | RTX 3090 24GB 或 RTX 4090 24GB | 先验证 3090;帧率或并发不足再升级 |
| CPU | 16 核左右 | 编码、WebRTC 和会话管理依赖 CPU |
| 内存 | 64GB | 降低模型与多服务并行的内存风险 |
| 硬盘 | 200GB 以上 NVMe | TensorRT 文件、角色资源、日志和镜像 |
| 系统 | Ubuntu 22.04 LTS | 固定 Python、CUDA、TensorRT 与驱动组合 |
| 网络 | 固定公网 IP、20Mbps 以上、支持 UDP | 公网复杂网络下需 TURN |
← 左右滑动查看更多 →
蚂蚁集团数字人3D动漫.mp4
视频未能加载。
该视频是动漫形象,不能替代真实老人照片或老照片上的效果验收。
系统先循环播放一段人物待机视频。当角色说话时,MuseTalk 根据音频替换嘴部区域,LiveTalking 负责实时视频传输、会话和网页接入。眨眼、呼吸、转头主要来自预先制作的待机视频,并不是 MuseTalk 实时生成。
| 可能失败点 | 客户看到的现象 | 上线前必须做的处理 |
|---|---|---|
| 待机视频质量差 | 人物像在漂,头发或背景晃动 | 建立固定生成与人工审核标准 |
| 循环点明显 | 每隔几秒重复眨眼或歪头 | 准备多段待机视频随机切换,但会增加制作成本 |
| 嘴部贴合失败 | 嘴边闪烁、胡须消失、嘴唇颜色变化 | 调节裁切参数,对胡须和特殊嘴型单独测试 |
| 说话状态不协调 | 眼睛和头部还在待机,只有嘴在动 | 设计 listening、speaking、thinking 等状态视频 |
| 角色生产成为瓶颈 | 系统可用,但新角色迟迟无法上线 | 先以 10 个真实角色测量制作工时 |
← 左右滑动查看更多 →
MuseTalk 官方说明其处理人脸区域为 256×256,胡须、嘴型和嘴唇颜色等身份细节可能无法完全保留。对于本项目,这不是小问题,必须作为角色验收项。
| 阶段 | 预计投入 | 主要产出 |
|---|---|---|
| 方案规划与技术验证 | 3–4 人日 | 跑通模型,确定待机视频要求 |
| 实际开发与系统接入 | 7–10 人日 | 接入音频、角色、会话、WebRTC 与异常处理 |
| 角色生产流程开发 | 4–6 人日 | 待机视频生成、裁剪、循环和审核流程 |
| 调试与测试 | 6–9 人日 | 口型、循环、长通话、断线及单路压测 |
| 首次生产部署 | 2–4 人日 | 模型、监控、网络和自动恢复 |
| 合计 | 22–33 人日 | 约 4.5–7 周;新增角色仍需制作 |
← 左右滑动查看更多 →
| 成本项目 | 预算参考 | 说明 |
|---|---|---|
| 技术验证算力 | 约 200–500 元 | 可先按小时租 3080Ti 验证单角色 |
| GPU 基础价格示例 | 约 445 元/月 | 3080Ti 同等级实例快照 |
| 建议生产月预算 | 约 900–2500 元/月起 | 包含 GPU、业务服务器、存储、监控和实时通信中继 |
| 常规技术维护 | 约 1–2 人日/月 | 服务、日志、网络、证书和模型环境 |
| 新增角色 | 约 0.5–1.5 人日/个 | 待机视频、循环点、MuseTalk 预处理和验收 |
← 左右滑动查看更多 →
| 项目 | 建议配置 | 原因 |
|---|---|---|
| GPU | RTX 3080Ti 12GB 起 | 按 LiveTalking 的实时推荐起点;更高质量或并发考虑 3090 |
| CPU | 12–16 核 | 视频编码与多路播放持续占用 CPU |
| 内存 | 32–64GB | 角色缓存和视频素材较多时优先 64GB |
| 硬盘 | 150GB 以上 NVMe | 模型、待机视频、角色预处理文件和日志 |
| 系统 | Ubuntu 22.04 LTS | 固定 FFmpeg、CUDA 与依赖版本 |
| 网络 | 固定公网 IP、20Mbps 以上、支持 UDP | 浏览器复杂网络仍需 TURN |
← 左右滑动查看更多 →
mouthtall.mp4
视频未能加载。
评审时必须说明:其中头部和身体动作主要来自基础视频,MuseTalk 主要负责嘴型变化。
| 比较项 | FlashHead | Ditto | MuseTalk |
|---|---|---|---|
| 规划与验证 | 4–6 人日 | 4–6 人日 | 3–4 人日 |
| 实际开发 | 10–15 人日 | 12–18 人日 | 11–16 人日,含角色流程 |
| 调试与测试 | 8–12 人日 | 8–12 人日 | 6–9 人日 |
| 首次生产部署 | 3–5 人日 | 3–5 人日 | 2–4 人日 |
| 总投入 | 25–38 人日 | 27–41 人日 | 22–33 人日 |
| 日历时间参考 | 5–8 周 | 6–9 周 | 4.5–7 周 |
| 验证算力预算 | 300–800 元 | 250–700 元 | 200–500 元 |
| 生产月预算 | 2000–4500 元起 | 1500–4000 元起 | 900–2500 元起 |
| 常规月维护 | 1.5–3 人日 | 1.5–3 人日 | 1–2 人日,另加角色制作 |
| 新增角色 | 0.25–0.75 人日 | 0.25–0.75 人日 | 0.5–1.5 人日 |
← 左右滑动查看三个方案 →
以上生产月预算按“一路稳定通话、小规模试用、单 GPU”估算,不包含研发人工。若要求 24 小时高可用、自动扩容、两地备份、正式云服务 SLA 或多路同时通话,费用会显著上升。
| 共同风险 | 客户会看到什么 | 项目必须提前做什么 |
|---|---|---|
| 输入照片不合格 | 脸变形、嘴型不稳、眼睛异常 | 制定正脸、清晰度、遮挡、光线和裁切标准;上传时自动检查 |
| 单张照片不含侧脸、牙齿 | 模型补出的细节不像本人 | 限制动作幅度;明确单张照片无法还原所有未知细节 |
| 音画链路延迟 | 听到声音后嘴巴才动 | 在同一时间轴处理音频与视频,记录每段耗时 |
| 长通话不稳定 | 卡顿、黑屏、漂脸、内存上涨 | 至少进行 10 分钟和 30 分钟连续通话测试 |
| 家庭网络限制 UDP | 部分用户始终连接不上 | 配置 TURN 中继,并测试移动网络、公司网络和家庭宽带 |
| 显卡实例或驱动变化 | 昨天能用,今天启动失败 | 锁定环境镜像,保留模型副本,先测试后升级 |
| 权限和数据保护不足 | 逝者照片或声音被误用、泄露或无法删除 | 获取授权、限制访问、加密存储、记录操作并支持彻底删除 |
| 合规准备不足 | 上线后被要求整改或暂停 | 上线前确认内容标识、个人信息保护、安全评估和算法备案义务 |
← 左右滑动查看更多 →
正式面向公众上线前,应就人格模拟、逝者照片与声音授权、生成内容标识、个人信息保护等事项取得专业合规意见。本文不是法律意见。
完成角色创建、会话启动释放、实时画面、异常提示、日志、监控和生产部署。初期只承诺一路稳定通话。
建议先给 5–10 名真实用户试用,记录连接成功率、首帧时间、掉线、主动退出原因和人物相似度反馈。问题未稳定复现和修复前,不扩大用户量。
小规模试用稳定后,再测试两路、三路并发并决定是否增加 GPU;此时再制定容量已满提示、维护窗口和故障恢复规则。
| 验收项 | 建议标准 | 不通过时如何处理 |
|---|---|---|
| 人物相似度 | 10 个真实样例中至少 8 个获客户通过,且不得出现严重五官变化 | 更换照片或调整动作范围;仍不通过则否决该方案 |
| 嘴型与音画同步 | 正常网络下无持续可感知错位;技术目标约 300ms 内 | 排查音频分片、时间戳、编码与缓冲 |
| 实时帧率 | 最终推流约 25 FPS,不出现持续数秒的明显卡顿 | 降低分辨率、优化编码或升级 GPU |
| 首帧时间 | 建议目标为发起通话后 5 秒内看到人物画面 | 预热、角色缓存、服务常驻 |
| 长时间稳定性 | 连续通话 30 分钟无崩溃、黑屏、明显漂脸或延迟累积 | 修复后重新完整测试,不能只验证一分钟 |
| 断线与资源释放 | 断线超时后显存、会话和角色占用全部释放 | 增加会话状态与超时回收日志 |
| 新角色创建 | 不合格照片有明确提示;合格照片按流程进入审核 | 补充图片检测与人工审核状态 |
← 左右滑动查看更多 →