3D数字人桌面智能小助手配置教程

想让桌面上住进一个会说、会动、有表情的 3D 数字人吗?本文从零开始,带你完成「软件安装 → 3D数字人创建 → DeepSeek API 申请 → 桌面小助手配置」全流程,最后再拆解它的开发原理与二次开发方向。

一、安装软件

文件解压缩,找到 exe 文件,双击运行(绿色软件免安装)。软件启动后显示设置页面,可以看到需要配置以下信息:

  • 名称:根据个人喜好输入即可
  • 3D数字人应用ID、应用密钥:见第二节内容
  • DeepSeek大语言模型API Key:见第三节内容
软件设置页面
软件设置页面

二、3D数字人配置

注册魔珐星云账户:https://xingyun3d.com/,点击右上角登录/注册按钮,进入注册流程。

魔珐星云网站首页
图1 魔珐星云网站首页

在注册页面,勾选同意按钮,选择其它登录方式,输入手机号、验证码及邀请码(XDBAC5Q6KM)注册。

福利提示:使用此内测邀请码可得 2000 分钟免费体验权,加上新用户注册赠送的 200 分钟体验时长,合计 2200 分钟免费时长

注册页面
图2 注册页面

登录后,进入具身驱动页面,选择个人喜欢的数字人形象,然后点击创建同款应用

具身驱动页面
图3 具身驱动页面

在设置页输入应用信息,点击创建并进入调试即可。

应用设置页面
图4 应用设置页面

创建成功后,点击场景,选择形象背景,这里推荐选择透明"背景-全身"。音色、表演等功能按照个人喜好设置即可。人物配置设置完成后,点击右上角的预览效果,查看数字人实际呈现效果。

人物设置页面
图5 人物设置页面
人物预览效果
图6 人物预览效果

确认人物语音播放正常后,点击右上角"接入SDK"按钮,记录 App ID、App Secret 信息。这两段信息就是调用此数字人的钥匙 🔑,请做好保存,稍后把它们复制到软件设置页面的对应位置。

魔珐星云数字人应用ID及密钥
图7 魔珐星云数字人应用ID及密钥

三、DeepSeek账号注册

注册 DeepSeek 账户:https://www.deepseek.com,点击API开放平台进行注册。

DeepSeek首页图
图8 DeepSeek首页图

登录后,点击左侧充值页面。DeepSeek 作为最具性价比的国内大语言模型,为智能助手充值 10 元足够用一年

DeepSeek充值页面
图9 DeepSeek充值页面

账户充值完毕后,点击左侧的 API Keys 按钮,点击创建 API Key,输入名称(比如"桌面智能小助手"),点击创建。此时弹出的 API Key 就是外部调用 DeepSeek 大模型对话的钥匙 🔑。

注意:此页面仅显示一次,点击复制后请做好留存,稍后把它复制到软件设置页面的对应位置。

DeepSeek创建API Key页面
图10 DeepSeek创建API Key页面

四、配置桌面智能小助手

双击打开软件,软件启动后显示设置页面,按照以下信息完成配置:

  • 名称:根据个人喜好输入即可
  • 3D数字人应用ID、应用密钥:输入魔珐星云创建应用的 ID 和密钥
  • DeepSeek大语言模型API Key:输入 DeepSeek API Key

点击右下角的保存及校验按钮,稍等片刻,确认校验无误则配置成功,此时小助手将成功渲染到桌面。

桌面小助手运行图
图11 桌面小助手运行图

五、开发介绍

1. 具备功能

  • 人物支持桌面内随意拖拽
  • 点击人物身体听到"滴"提示音开启语音对话(初次对话需要几秒钟加载语音识别模型)
  • 默认接入 DeepSeek 大模型快速响应
  • 人物口型、表情、动作及情绪等和对话内容高度统一,情绪价值拉满
  • 文件包含所有工程文件,支持二次开发优化
  • 离线语音识别模型,高隐私性、响应快
  • 配置 VAD 语音活动检测功能(准确识别人声开始及结束)

2. 软件整体结构

级联链路:ASR + LLM + TTS

  • ASR:采用 OpenAI 开源的 whisper 语音识别模型,识别用户说话,并转化为文字送至 LLM;
  • LLM:采用 DeepSeek 国内最高性价比大语言模型,处理 ASR 转化的文字,并输出反馈至 TTS;
  • TTS:采用魔珐星云 3D 数字人自带语音合成模型,将 LLM 反馈的文本合成带语气、语调的音频播放给用户。

3. 二次开发方向

  • 升级 ASR:当前采用的 whisper 体积小、便携性高,但参数也小,语音识别准确率并非最优。不考虑软件体积的情况下,可以考虑升级参数更高的 ASR 模型。
  • Realtime Speech-to-Speech:取消本地离线 ASR(缺点:识别准确率不高),直接调用多模态大模型,用户输入音频至大模型,大模型反馈文本至魔珐星云输出。
  • 增加唤醒词检测(如"Hey 宝贝"),比点击人物体验感更好。
  • 增加功能性(偏向 Agent):通过语音对话让其帮忙设置定时任务、操作电脑增删文件等等。

建议:整套方案只需 2200 分钟免费数字人时长 + 10 元 DeepSeek 充值,即可让桌面住进一个随时可以聊天、还会跟着情绪做表情动作的 3D 数字人。对 AI 语音交互感兴趣的同学,很适合作为入门项目研究。

推荐工具