Skip to main content

4.1 语音

1. 适用范围

本章介绍 SpacemiT Robot SDK 中与语音交互相关的基础能力,包括语音活动检测、声纹识别、语音识别和语音合成。它们可以单独集成,也可以组合成端到端语音链路:

麦克风采集 -> VAD 断句 -> 声纹验证(可选) -> ASR 转写 -> LLM 推理 -> TTS 合成 -> 扬声器播放

语音模块主要面向 K3 机器人语音助手、离线语音识别、说话人验证、语音播报和 omni_agent 端到端对话应用。音频采集、播放、重采样和声源定位属于多媒体基础能力,见 多媒体总览

2. 文档关系

  • 前置阅读:先了解 6.3.3 audio,确认录音、播放、设备索引和采样率配置。
  • 组合应用:端到端语音对话见 4.5 Agent,其中串联了 VAD、ASR、LLM、TTS、声纹和 MCP 工具调用。
  • 仓库路径:
    • ASR:components/model_zoo/asr
    • TTS:components/model_zoo/tts
    • VAD:components/model_zoo/vad
    • 声纹:components/model_zoo/voiceprint
    • 语音对话应用:application/native/omni_agent

3. 阅读索引

建议按下表顺序阅读。只做语音播报时可以直接阅读 TTS;只做说话人验证时可以直接阅读声纹。

序号文档摘要
14.1.3 VAD使用 Silero VAD 检测语音开始和结束,为 ASR 断句、barge-in 和低功耗监听提供前置能力。
24.1.4 声纹使用 CamP+ 提取 192 维 embedding,支持注册、识别和 1:1 验证。
34.1.1 ASR使用 SenseVoice、Zipformer、Qwen3-ASR、Fun-ASR Nano 或 Gemma4 ASR 进行语音转写;Gemma4 ASR 还支持外语语音转英文。
44.1.2 TTS使用 Matcha-TTS 或 Kokoro 将文本合成为 WAV/PCM,支持文件合成和流式播放。
54.5 Agent组合音频、VAD、声纹、ASR、LLM、TTS 和 MCP,运行完整语音助手。