示例运行
1. 前置条件
语音交互功能需搭配 USB 音频输入与输出设备使用。
2. 模型体验
SDK 提供以下 AI 能力,均可通过一键编译生成可运行的应用程序。详细说明请参阅 04-AI与算法。
| 类别 | 能力 | 组件路径 | 详细文档 |
|---|---|---|---|
| 语音 | ASR 语音识别 | components/model_zoo/asr | 4.1.1-ASR |
| TTS 语音合成 | components/model_zoo/tts | 4.1.2-TTS | |
| VAD 语音活动检测 | components/model_zoo/vad | 4.1.3-VAD | |
| 声纹识别 | components/model_zoo/voiceprint | 4.1.4-声纹 | |
| 视觉 | 目标检测 | components/model_zoo/vision | 4.2.1-目标检测 |
| 实例分割 | components/model_zoo/vision | 4.2.2-实例分割 | |
| 人体姿态 | components/model_zoo/vision | 4.2.3-人体姿态 | |
| 人脸检测 | components/model_zoo/vision | 4.2.4-人脸检测 | |
| 手势识别 | components/model_zoo/vision | 4.2.5-手势识别 | |
| 图像分类 | components/model_zoo/vision | 4.2.6-图像分类 | |
| 表情与情绪识别 | components/model_zoo/vision | 4.2.7-表情与情绪识别 | |
| 行为识别 | components/model_zoo/vision | 4.2.8-行为识别 | |
| 多目标跟踪 | components/model_zoo/vision | 4.2.9-多目标跟踪 | |
| 人脸识别 | components/model_zoo/vision | 4.2.10-人脸识别 | |
| LLM | 大语言模型 | components/model_zoo/llm | 4.4-LLM |
| VLM | 视觉语言模型 | components/model_zoo/vlm | 4.6-VLM |
| Agent | 智能体 | application/native/omni_agent | 4.5-Agent |
以下以视觉目标检测为例,演示编译与运行流程。
2.1 一键编译
cd components/model_zoo/vision
mm
2.2 快速运行
下载模型资源:
bash examples/yolov8/scripts/download_models.sh
bash scripts/download_assets.sh
运行检测:
yolov8 examples/yolov8/config/yolov8.yaml
(可选)使用摄像头进行实时检测:
yolov8 examples/yolov8/config/yolov8.yaml --use-camera --camera-id 0 # 请确认摄像头 ID
3. 语音交互
本节以 Omni Agent 为例,演示语音交互功能的编译与运行。
3.1 一键编译
cd 项目根目录
lunch
选择目标方案:
You're building on Linux
Lunch menu... pick a combo:
1 k1-muse-pipro-minimal
2 k3-com260-kit-humanoid-asimov
3 k3-com260-kit-humanoid-qinglong
4 k3-com260-kit-humanoid-tiangong
5 k3-com260-kit-humanoid-tinker
6 k3-com260-kit-humanoid-unitree-g1
7 k3-com260-kit-humanoid-unitree-go1
8 k3-com260-kit-humanoid-unitree-h1_2
9 k3-com260-kit-humanoid-unitree-r1
10 k3-com260-linksee
11 k3-com260-minimal
12 k3-com260-reachy-mini
13 kx-generic-omni_agent
选择 kx-generic-omni_agent,执行编译:
m # 一键编译
3.2 快速运行
下载模型资源:
mkdir -p ~/.cache/models/llm
cd ~/.cache/models/llm
# 示例下载qwen2.5 0.5b的模型
wget https://archive.spacemit.com/spacemit-ai/model_zoo/llm/qwen2.5-0.5b-instruct-q4_0.gguf
启动 LLM 服务:
llama-server -m ~/.cache/models/llm/qwen2.5-0.5b-instruct-q4_0.gguf -t 8 --port 8080
启动语音对话:
voice_chat --llm-url http://localhost:8080 --model qwen2.5:7b --tts matcha:zh-en