# VoxEMW 全云 API 化:接入 dsh 修订方案(零自托管模型) - **日期**:2026-09-09(22:50 版) - **性质**:对《VoxEMW接入dsh调研与落地方案_20260909.md》的**方向性修订**——用户决策:**模型全部连线上 API,不部署任何本地模型** - **一句话**:不再"代理运行 VoxEMW 那套 GPU 服务",而是**以 VoxEMW 为产品与体验蓝本,复用其 persona 文案与 `assets/mojingnvwu/face_ref.jpg` 形象资产,后端全部换成 2026 年已商业化的云端实时 API**,由 dsh 插件做编排/代理/隔离。 > ⚠️ **重要更正**:前一版文档 §4 判断"实时写实数字人渲染没有等价公开 API"——该判断已被 2026-09 市场现状推翻:火山引擎「实时互动数字人 API(FlowAct-R1)」、阿里云「数字人实时交互 OpenAPI」、ZEGO「精品照片数字人」均已提供"图片/形象 + 音频流 → 实时视频流"的商业 API。全云 API 路线**可行**,本文即按此重写。 --- ## 一、决策影响对照(原方案 → 修订方案) | 维度 | 原方案(代理 VoxEMW GPU 服务) | 修订方案(全云 API) | |---|---|---| | 模型部署 | 4090 主机四模型本地常驻(21.7G/24G) | **零本地模型**,全部云端 API | | GPU 主机/隧道 | 需要 | **移除**,不需要任何自管 GPU | | VoxEMW 代码 | 运行上游 python 全套 | **不运行**,仅作蓝本(UI 氛围/协议形态/人设) | | 核心工作 | 守护 + 反向代理 + 槽位 | **云端编排层**(Realtime WS 对接 + 数字人流对接 + 人设注入) | | 用户数据隔离 | 槽位 + persona 映射 + 零持久化 | 槽位/配额 + profile 维度记账 + 云端 session 独立 + 第三方合规提示 | | 需要决策的新增项 | — | 供应商组合、数字人形象图、音色路线(见 §七) | --- ## 二、2026-09 云端供给盘点(VoxEMW 六积木逐块替换) ### 2.1 替换矩阵 | VoxEMW 积木 | 等价云 API(已核实存在) | 关键参数/证据 | |---|---|---| | ① VAD + ② STT | 并入"端到端 Realtime 模型"(自带 server VAD + 自动打断),或单独接讯飞/火山/阿里实时 ASR | 端到端更省事,见 2.2 | | ③ LLM 大脑 | 端到端模型自带大脑;或保留 DeepSeek API(分离式时) | 魔镜人设走 `instructions`(session.update),与 VoxEMW 注入 persona 同思路 | | ④ TTS 音色 | 端到端预置音色(列表切换);要"专属音色/克隆"则分离式接 MiniMax / 阿里 CosyVoice / 火山豆包 | 见 §六体验差异(音色设计能力是最大降级点) | | ⑤ **写实数字人** | **火山「实时互动数字人 API (FlowAct-R1)」**:单张人物图 + 16kHz PCM 音频流 → 实时视频流,480P@25fps,首帧 ~2s,声画毫秒同步([docs.volcengine.com](https://docs.volcengine.com/docs/86081/2387261))
或 **阿里云数字人实时交互 OpenAPI**:WebSocket + streamed audio driver,支持 `customUserId`(天然适合租户标记)([help.aliyun.com](https://help.aliyun.com/en/me/getting-started/digital-human-real-time-interactive-openapi))
或 **ZEGO 精品照片数字人**:1 张照片 200ms、1080P,走 RTC 视频互动([doc-zh.zego.im](https://doc-zh.zego.im/aiagent-mini-program/introduction/overview)) | 单图输入 → **`assets/mojingnvwu/face_ref.jpg` 可直接复用** | | ⑥ 眼睛 VLM | **GLM-Realtime**(音视频通话模型,WebSocket,支持摄像头帧输入、function calling、server VAD、可打断)
或 **阿里 Qwen-Omni-Realtime / qwen3.5-omni-plus-realtime**(DashScope,WS 与 WebRTC 双通道,视频帧输入) | 摄像头帧走同一条 Realtime WS,天然实现"她看得见你" | ### 2.2 端到端 Realtime vs 分离式(架构大方向二选一) | | 端到端 Realtime(**推荐**) | 分离式(ASR + LLM + TTS 各选一家) | |---|---|---| | 做法 | 一个 WebSocket 完成"听→想→说",服务端 VAD/打断全托管 | 每环节独立 API,自行拼装状态机 | | 延迟/体验 | 低(0.3~0.5s 级开口),打断顺滑 | 每跳多一次网络,拼装复杂、易抖 | | 音色自由度 | 预置音色列表(GLM-Realtime 提供 tongtong/xiaochen/female-tianmei…) | 可用 MiniMax/CosyVoice 克隆"魔镜专属嗓音" | | 视觉(眼睛) | GLM-Realtime / Qwen-Omni 直接吃视频帧 | 需另接 VLM API | | 计费参考 | GLM-Realtime-Flash:音频 0.18 元/分,视频 1.2 元/分;Air:0.3 / 2.1 元/分([docs.bigmodel.cn](https://docs.bigmodel.cn/cn/guide/models/sound-and-video/glm-realtime)) | 各家按量,总价通常更高 | **推荐组合**(两个候选,M1 前拍板): - **组合甲(默认推荐)**:端到端大脑+声音 = **智谱 GLM-Realtime**;出画 = **火山 FlowAct-R1**(单图+音频流)。理由:中文生态、GLM-Realtime 带视频+function calling、成本低、火山数字人与豆包端到端语音同族可平滑替换。 - **组合乙(同厂商偏好)**:端到端 = **阿里 Qwen-Omni-Realtime**(视频帧原生);出画 = **阿里实时数字人 OpenAPI**(带 `customUserId`,租户标记友好)。理由:一家计费/控制台,WebRTC 浏览器直连低延迟。 --- ## 三、目标架构(修订后) ``` ┌──────────── 用户浏览器(dsh 会话窗口右侧分栏面板,同源 https)───────────┐ │ 魔镜面板(轻量前端,蓝本=VoxEMW web/ 的氛围,但重写为云版) │ │ ├─ 麦克风采集 16kHz PCM → host 代理 → 云 Realtime WS │ │ ├─ 摄像头帧(可选"眼睛")→ host 代理 → 同一 Realtime WS │ │ └─ 云数字人视频流 →